Как работает инструмент Создать эмбеддинги с помощью моделей ИИ
Доступно с лицензией Image Analyst.
Доступно с лицензией Advanced.
Создание эмбеддингов — это процесс преобразования необработанных пространственных или связанных данных в числовые векторные представления, которые отражают семантическое значение. Эти векторные представления, известные как эмбеддинги, позволяют сравнивать изображения, географические положения, атрибуты и текстовые описания на основе сходства в общем пространстве эмбеддингов. Для создания эмбеддингов изображений требуется дополнительный модуль Image Analyst, а для создания эмбеддингов местоположения или текста — лицензия Advanced в ArcGIS Pro.
Инструмент Создать эмбеддинги с помощью моделей ИИ использует предварительно обученные модели для создания эмбеддингов для пространственных данных. В зависимости от выбранной модели инструмент может создать следующее:
Визуальные эмбеддинги из изображений
Эмбеддинги местоположений из географических объектов
Текстовые эмбеддинги текстовых полей
Зрительно-языковые или мультимодальные эмбеддинги, сочетающие изображения или пространственный контекст и текст
Созданные эмбеддинги записываются в выходном классе объектов в поле больших двоичных объект (BLOB) с именем Embedding, и могут использоваться для нескольких последующих рабочих процессов в ArcGIS.
Возможное применение
Рабочие процессы на основе эмбеддингов выходят за рамки сходства изображений и поддерживают множество сценариев пространственного анализа, включая следующие:
Поиск по семантическому сходству — определите пространственные объекты, области изображения или места, семантически схожие с заданными входными данными.
Анализ изменений — сравните эмбеддинги, созданные из изображений, полученных в разные временные периоды.
Семантический поиск на естественном языке — используйте описательные текстовые запросы, например, большая парковка с множеством автомобилей или прибрежную жилую зону, чтобы получить соответствующие изображения или местоположения.
Сходство местоположений — определите места с похожим географическим, экологическим или пространственным контекстом.
Кластеризация и исследовательский анализ — группируйте пространственные объекты на основе сходства эмбеддингов без заранее заданных меток.
Используйте эмбеддинги в качестве многомерных семантических объектов для задач регрессии, классификации или прогнозного моделирования в ArcGIS Pro. Эмбеддинги часто повышают точность работы моделей, поскольку они улавливают сложные пространственные и контекстные связи, которые могут быть упущены при использовании традиционных, созданных вручную признаков.
Модели генерации эмбеддингов создают компактные, изученные, фиксированной длины числовые представления необработанных входных данных. Эти модели могут включать в себя как крупномасштабные базовые модели, обученные на массивных наборах данных, так и специализированные модели эмбеддингов, такие, как визуальные кодировщики или языковые модели, например, текстовые кодировщики на базе архитектуры трансформеров, подобные BERT. Инструмент поддерживает предварительно обученные модели эмбеддингов, подходящие для выбранного метода ввода.

При вводе данных на основе изображений, таких как спутниковые снимки или аэрофотоснимки, модель обрабатывает пиксельные данные для изучения визуальных закономерностей, пространственной структуры и контекстных отношений, создавая эмбеддинги, которые представляют семантическое содержание изображения или области, а не необработанные пиксельные значения. При использовании зрительно-языковых или мультимодальных моделей изображения и текст проецируются в общее пространство эмбеддингов, включая поиск изображений на естественном языке и сравнение кросс-модальное сходства.
Для входных данных, основанных на местоположении, модель преобразует географическую информацию, такую как геометрия объектов, в эмбеддинги, которые отражают пространственные характеристики, такие как закономерности землепользования, плотность, рельеф местности и отношения близости. Места с похожим географическим контекстом расположены ближе друг к другу в пространстве эмбеддингов, что позволяет анализировать сходство на основе пространственной семантики, а не только сопоставления атрибутов.
Для текстовых входных данных текстовые поля, такие как описания или метаданные, преобразуются в эмбеддинги, фиксирующие семантический смысл. Это поддерживает запросы на естественном языке, семантическое сравнение описаний объектов и интеграцию текстовой информации в рабочие процессы пространственного анализа.
Во всех модальностях эмбеддинги сохраняют семантическое сходство: входные данные со схожим визуальным, пространственным или текстовым значением создают векторы, которые находятся ближе друг к другу в пространстве эмбеддингов. Это позволяет осуществлять поиск по сходству, кластеризацию, извлечение данных, ранжирование объектов и прогнозное моделирование в ArcGIS Pro, обеспечивая единую основу для семантического пространственного анализа.
Создать эмбеддинги с помощью моделей ИИ
Вы можете использовать инструмент Создать эмбеддинги с помощью моделей ИИ для генерации эмбеддингов пространственных данных с использованием предварительно обученных эмбеддингов или базовых моделей. Этот инструмент не требует обучения модели или размеченных данных. Вместо этого он применяет предварительно обученные модели для преобразования необработанных пространственных или текстовых входных данных в векторы эмбеддингов фиксированной длины, передающих семантическое значение.
Эти эмбеддинги затем могут быть использованы в последующих рабочих процессах, основанных на эмбеддингах, включая следующие
Поиск сходства
Пространственная кластеризация
Модели прогнозирования и классификации
Анализ закономерностей на основе местоположения
Пространственный анализ на основе текста
Благодаря использованию эмбеддингов в качестве многомерных семантических признаков, последующие задачи анализа часто выигрывают за счет лучшей обобщающей способности моделей и снижения потребности в ручном конструировании признаков.
Как работает инструмент
Инструмент принимает пространственные входные данные, такие как растровые изображения, географические объекты или текстовые атрибуты. Выбранная модель эмбеддингов обрабатывает входные данные и создает семантические эмбеддинги. Затем эмбеддинги записываются в выходной класс объектов для повторного использования.
Растровые входные данные
Для растровых изображений эмбеддинги создаются по обычной пространственной сетке. Каждая ячейка сетки представляет определенную область на поверхности земли и создает один эмбеддинг, обобщающий семантическое содержание в пределах этой области.
Векторные входные данные (местоположение)
Для ввода географических объектов инструмент выполняет следующие действия:
Эмбеддинги могут создаваться непосредственно для каждого объекта.
Поле
SHAPE(геометрии) используется для получения пространственного контекста.Каждый объект получает один эмбеддинг, представляющий его пространственную семантику.
Входные данные - текстовые поля
Когда указано текстовое поле, инструмент выполняет следующее:
Выбранный текстовый атрибут обрабатывается с помощью предварительно обученной модели текстовых эмбеддингов.
Каждая запись создаёт семантический эмбеддинг, полученный из её текстового содержания.
Текстовые эмбеддинги могут использоваться независимо или комбинироваться с пространственными эмбеддингами в мультимодальных рабочих процессах.
Выходной класс объектов эмбеддингов
Итоговые эмбеддинги записываются в выходной класс объектов, включающий следующее:
Исходные атрибуты не эмбеддингов.
Выделенное
Embeddingполе, хранящееся как esriFieldTypeBlob.
Поскольку эмбеддинги хранятся как векторные представления с возможностью повторного использования, их можно эффективно использовать в инструментах анализа на основе эмбеддингиов без их повторного создания.
Формат хранения эмбеддингов
Эмбеддинги представлены как вектор Float32 фиксированной точности и сохраняются в поле больших двоичных объектов (BLOB) с именем Embedding. Каноническое представление на диске представляет собой последовательность необработанных байт, содержащую значения эмбеддингов, которые закодированы как 32-битные формата IEEE-754 с порядком байтов от младшего к старшему (little-endian) числа с плавающей запятой (<f4) и сохранены последовательно в порядке расположения элементов (индекс 0, 1, …, D-1). Этот формат компактен, быстрый в чтении и записи, а также не зависит от языка; любая среда выполнения может восстановить вектор, интерпретируя байты BLOB как значения float32 little-endian.
Размерность эмбеддинга D фиксирована для каждой модели; следовательно, ожидаемый размер полезной нагрузки равен D * 4 байтам. Когда эмбеддинги должны передаваться через текстовые каналы, например, через JSON или REST API сервисов объектов ArcGIS, та же самая бинарная полезная нагрузка транспортируется в виде строки Base64. Не предполагается использование каких-либо платформо-специфичных структур размещения или языково-специфичных методов сериализации, помимо явно указанного соглашения о порядке байтов little-endian для формата float32.
Рекомендации
Ниже приведены рекомендации по использованию этого инструмента.
Выбор размера сетки эмбеддинга для изображений
При создании эмбеддингов на основе растровых изображений параметр Размер сетки определяет площадь земной поверхности, суммируемую по каждому эмбеддингу. Поскольку поиск сходства выполняется на основе этих эмбеддингов, размер сетки влияет на точность представления и сопоставления объектов.
Если размер сетки слишком велик относительно целевых объектов, несколько объектов и окружающий фон могут быть объединены в одном эмбеддинге. Это может привести к более широким откликам сходства и снизить точность границ. Если размер сетки слишком мал, объекты могут быть фрагментированы по множеству ячеек эмбеддингов, что может сделать акцент на локальной, а не на общей структуре.
В целом эффективные результаты получаются, когда объект интереса охватывает несколько ячеек эмбеддингов, а не находится только в одной. Это помогает сбалансировать структурные детали и контекстную полноту.
Интерпретация эффектов размера сетки

В приведённом выше примере эмбеддинги, созданные с использованием сетки размером 1,4 м, сохраняют структуру транспортного средства в нескольких ячейках, обеспечивая точное соответствие локализованного сходства. При размере сетки 2,8 метра каждый эмбеддинг охватывает большую область, что увеличивает контекстуальное смешение и приводит к более широкому спектру сходства.
Поскольку размеры объектов, разрешение изображения и цели анализа различны, не существует единого оптимального размера сетки. Вам следует выбрать размер сетки, который соответствует масштабу и структурной сложности идентифицируемых объектов. Тестирование нескольких размеров сеток и сравнение закономерностей сходства помогут определить наиболее подходящую конфигурацию для вашего рабочего процесса.