Skip to main content

Cómo funciona Generar incorporaciones con modelos de IA

Disponible con licencia de Image Analyst.

Disponible con una licencia Advanced.

Generar incorporaciones es el proceso de convertir datos espaciales sin procesar u otros datos relacionados en representaciones vectoriales numéricas que capturan el significado semántico. Estas representaciones vectoriales, conocidas como incorporaciones, permiten comparar imágenes, ubicaciones geográficas, atributos y descripciones de texto en función de su similitud dentro de un espacio de incorporación compartido. La generación de incorporaciones de imágenes requiere la extensión Image Analyst, mientras que la generación de incorporaciones de ubicación o texto requiere la licencia Advanced en ArcGIS Pro.

La herramienta Generar incorporaciones con modelos de IA utiliza modelos preentrenados para generar incorporaciones de datos espaciales. Dependiendo del modelo seleccionado, la herramienta puede generar lo siguiente:

  • Incorporaciones visuales a partir de imágenes

  • Incorporaciones de ubicación a partir de entidades geográficas

  • Incorporaciones de texto a partir de campos de texto

  • Incorporaciones de lenguaje visual o multimodales que combinan imágenes o contexto espacial y texto

Las incorporaciones generadas se escriben en un campo de objeto binario grande (BLOB) denominado Embedding en la clase de entidad de salida y pueden utilizarse en varios flujos de trabajo posteriores en ArcGIS.

Potenciales aplicaciones

Los flujos de trabajo basados en incorporaciones van más allá de la similitud de imágenes y admiten muchos escenarios de análisis espacial, incluidos los siguientes:

  • Búsqueda por similitud semántica: identifica entidades espaciales, regiones de imágenes o ubicaciones que sean semánticamente similares a una entrada determinada.

  • Análisis de cambios: compara incorporaciones generadas a partir de imágenes capturadas en diferentes periodos de tiempo.

  • Búsqueda semántica en lenguaje natural: utiliza consultas de texto descriptivas, por ejemplo, aparcamiento grande con gran densidad de vehículos o zona residencial costera, para recuperar imágenes o ubicaciones relevantes.

  • Similitud de ubicación: identifica lugares con un contexto geográfico, ambiental o espacial similar.

  • Clustering y análisis exploratorio: agrupa entidades espaciales en función de la similitud entre incorporaciones sin etiquetas predefinidas.

Utilice incorporaciones como características semánticas de alto nivel para tareas de regresión, clasificación o modelado predictivo en ArcGIS Pro. Las incorporaciones suelen mejorar el rendimiento del modelo al capturar relaciones espaciales y contextuales complejas que las características tradicionales diseñadas manualmente pueden pasar por alto.

Los modelos de generación de incorporaciones crean representaciones numéricas compactas, aprendidas y de longitud fija a partir de entradas sin procesar. Estos modelos pueden incluir modelos de fundación a gran escala entrenados con enormes datasets, así como modelos especializados de incorporación, como codificadores visuales o modelos de lenguaje; por ejemplo, codificadores de texto basados en transformadores similares a las arquitecturas BERT. La herramienta admite modelos de incorporación preentrenados que son adecuados para la modalidad de entrada seleccionada.

Cómo se generan las incorporaciones

Para entradas basadas en imágenes, como imágenes satelitales o aéreas, el modelo procesa datos de píxeles para aprender patrones visuales, estructura espacial y relaciones contextuales, y produce incorporaciones que representan el contenido semántico de una imagen o región en lugar de los valores de píxeles sin procesar. Cuando se utilizan modelos de lenguaje visual o multimodales, las imágenes y el texto se proyectan en un espacio de incorporación compartido, lo que permite la búsqueda de imágenes en lenguaje natural y las comparaciones de similitud intermodal.

Para entradas basadas en ubicaciones, el modelo convierte información geográfica, como la geometría de las entidades, en incorporaciones que capturan características espaciales como patrones de uso del suelo, densidad, terreno y relaciones de proximidad. Las ubicaciones con un contexto geográfico similar se sitúan más cerca entre sí en el espacio de incorporación, lo que permite un análisis de similitud basado en la semántica espacial, y no solo en la coincidencia de atributos.

Para entradas basadas en texto, los campos textuales, como descripciones o metadatos, se transforman en incorporaciones que capturan el significado semántico. Esto admite consultas en lenguaje natural, comparación semántica de descripciones de entidades e integración de información textual en flujos de trabajo de análisis espacial.

En todas las modalidades, las incorporaciones preservan la similitud semántica: las entradas con un significado visual, espacial o textual similar producen vectores que están más próximos entre sí en el espacio de incorporación. Esto permite realizar búsquedas por similitud, clustering, recuperación, clasificación de características y modelado predictivo en ArcGIS Pro, lo que proporciona una base unificada para el análisis espacial basado en la semántica.

Generar incorporaciones con modelos de IA

Se puede usar la herramienta Generar incorporaciones usando modelos de IA para generar incorporaciones para datos espaciales mediante modelos de incorporación preentrenados o modelos fundacionales. Esta herramienta no requiere entrenamiento de modelos ni datos etiquetados. En su lugar, aplica modelos preentrenados para transformar entradas espaciales o textuales sin procesar en vectores de incorporación de longitud fija que capturan el significado semántico.

Estas incorporaciones pueden utilizarse posteriormente en flujos de trabajo posteriores basados en incorporaciones, incluidos los siguientes:

  • Búsqueda de similitud

  • Clustering espacial

  • Modelos de regresión y clasificación

  • Análisis de patrones basado en la ubicación

  • Análisis espacial basado en texto

Al utilizar incorporaciones como características semánticas de alto nivel, las tareas analíticas posteriores suelen beneficiarse de una mejor generalización y de una menor necesidad de ingeniería manual de entidades.

Cómo funciona la herramienta

La herramienta toma datos espaciales de entrada, como imágenes ráster, entidades geográficas o atributos de texto. Un modelo de incorporación seleccionado procesa la entrada y genera incorporaciones semánticas. A continuación, las incorporaciones se escriben en una clase de entidad de salida para su reutilización.

Entradas de ráster

Para imágenes ráster, las incorporaciones se generan sobre una cuadrícula espacial regular. Cada celda de la cuadrícula representa una superficie de terreno definida y produce una única incorporación que resume el contenido semántico dentro de esa región.

Entradas de entidad (ubicación)

Para las entradas de entidades geográficas, la herramienta realiza lo siguiente:

  • Las incorporaciones pueden generarse directamente por entidad.

  • El campo SHAPE (geometría) se utiliza para derivar el contexto espacial.

  • Cada entidad recibe una única incorporación que representa su semántica espacial.

Entradas de campos de texto

Cuando se especifica un campo de texto, la herramienta realiza lo siguiente:

  • El atributo de texto seleccionado se procesa mediante un modelo de incorporación de texto preentrenado.

  • Cada registro produce una incorporación semántica derivada de su contenido textual.

  • Las incorporaciones de texto pueden utilizarse de forma independiente o combinarse con incorporaciones espaciales en flujos de trabajo multimodales.

Clase de entidad de incorporaciones de salida

Las incorporaciones resultantes se escriben en una clase de entidad de salida que incluye lo siguiente:

  • Los atributos originales que no son de incorporación.

  • Un campo dedicado Embedding almacenado como esriFieldTypeBlob.

Como las incorporaciones se almacenan como representaciones vectoriales reutilizables, pueden utilizarse de forma eficiente en herramientas posteriores de análisis basadas en incorporaciones sin necesidad de regenerarlas.

Formato de almacenamiento de incorporaciones

Las incorporaciones se representan como un vector Float32 de precisión fija y se conservan en un campo de objeto binario grande (BLOB) denominado Embedding. La representación canónica en disco es una secuencia de bytes sin procesar que contiene los valores de incorporación codificados como números de coma flotante de 32 bits IEEE-754 little-endian (<f4), almacenados de forma contigua en orden de elementos (índice 0, 1, ..., D-1). Este formato es compacto, rápido de leer y escribir, e independiente del lenguaje; cualquier entorno de ejecución puede reconstruir el vector interpretando los bytes del BLOB como valores float32 little-endian.

La dimensión de incorporación D es fija para cada modelo; por lo tanto, el tamaño esperado de la carga útil es D * 4 bytes. Cuando las incorporaciones deben transmitirse a través de canales solo de texto, por ejemplo, JSON o las API REST de ArcGIS Feature Service, la misma carga útil binaria se transporta como una cadena Base64. No se presupone ningún diseño de estructura específico de una plataforma ni ninguna serialización específica de un lenguaje más allá de la convención explícita de float32 little-endian.

Prácticas recomendadas

Las siguientes se consideran prácticas recomendadas al utilizar la herramienta.

Seleccionar un tamaño de cuadrícula de incorporación para imágenes

Al generar incorporaciones a partir de imágenes ráster, el parámetro de tamaño de cuadrícula controla la superficie de terreno resumida por cada incorporación. Dado que la búsqueda por similitud opera sobre estas incorporaciones, el tamaño de cuadrícula influye en la precisión con la que los objetos se representan y se emparejan.

Si el tamaño de cuadrícula es demasiado grande en relación con los objetos de destino, varias entidades y el fondo circundante pueden combinarse dentro de una única incorporación. Esto puede producir respuestas de similitud más amplias y reducir la precisión de los límites. Si el tamaño de cuadrícula es demasiado pequeño, los objetos pueden fragmentarse en muchas celdas de incorporación, lo que puede enfatizar la textura local por encima de la estructura general.

En general, se obtienen resultados eficaces cuando el objeto de interés abarca varias celdas de incorporación, en lugar de quedar contenido en una sola. Esto ayuda a equilibrar el detalle estructural y la completitud contextual.

Interpretación de los efectos del tamaño de cuadrícula

Cómo se generan las incorporaciones

En el ejemplo anterior, las incorporaciones generadas con un tamaño de cuadrícula de 1,4 m conservan la estructura de los vehículos en varias celdas, lo que produce coincidencias por similitud muy localizadas. Con un tamaño de cuadrícula de 2,8 metros, cada incorporación resume una superficie mayor, lo que aumenta la mezcla contextual y da lugar a patrones de similitud más amplios.

Dado que los tamaños de los objetos, la resolución de las imágenes y los objetivos de análisis varían, no existe un único tamaño de cuadrícula óptimo. Se debe seleccionar un tamaño de cuadrícula que se ajuste a la escala y la complejidad estructural de las entidades que se desean identificar. Probar varios tamaños de cuadrícula y comparar los patrones de similitud puede ayudar a determinar la configuración más adecuada para el flujo de trabajo.