AI モデルを使用したエンベディングの生成の仕組み
Image Analyst ライセンスで利用可能。
Advanced のライセンスで利用可能。
エンベディングの生成とは、未処理の空間データや関連データを、意味論的意味を取得する数値ベクター表現に変換するプロセスです。 エンベディングと呼ばれるこれらのベクター表現により、画像、地理的な位置、属性、テキストの説明を、共有エンベディング空間内で類似性に基づいて比較できるようになります。 画像エンベディングの生成には Image Analyst エクステンションが必要ですが、位置またはテキスト エンベディングの生成には ArcGIS Pro の Advanced ライセンスが必要です。
AI モデルを使用したエンベディングの生成 ツールは、事前トレーニング済みモデルを使用して空間データのエンベディングを生成します。 選択したモデルに応じて、このツールは以下を生成できます:
画像からの視覚エンベディング
地理フィーチャからの位置エンベディング
テキスト フィールドからのテキスト エンベディング
画像または空間コンテキストとテキストを組み合わせた、視覚言語またはマルチモーダルのエンベディング
生成されたエンベディングは、出力フィーチャクラス内の Embedding という名前の BLOB (Binary Large Object) フィールドに書き込まれ、ArcGIS のさまざまな下流のワークフローで使用できます。
適用例
エンベディングに基づくワークフローは画像の類似性の枠を超え、以下を含む多くの空間解析シナリオをサポートします:
セマンティック類似検索 - 特定の入力と意味的に類似した空間フィーチャ、画像領域、または位置を特定します。
変化解析 - 異なる期間に取得した画像から生成されたエンベディングを比較します。
自然言語セマンティック検索 - 車両が密集している大きな駐車場 や 沿岸の住宅地 などの説明テキスト クエリーを使用して、関連する画像や位置を取得します。
位置の類似性 - 地理、環境、または空間コンテキストが類似している場所を特定します。
クラスタリングおよび探索的解析 - 事前定義されたラベルを使用せず、エンベディングの類似性に基づいて空間フィーチャをグループ化します。
ArcGIS Pro での回帰、分類、または予測モデリング タスクで、高度なセマンティック フィーチャとしてエンベディングを使用します。 エンベディングは多くの場合、従来の手作業で作成したフィーチャでは捉えきれない複雑な空間的およびコンテキスト上の関係を捉えることで、モデルのパフォーマンスを向上させます。
エンベディング生成モデルは、未加工の入力から、学習済みのコンパクトかつ固定長の数値表現を作成します。 これらのモデルには、膨大なデータセットでトレーニングされた大規模な基盤モデルや、BERT アーキテクチャーに似たトランスフォーマーに基づくテキスト エンコーダーなどの視覚エンコーダーや言語モデルのような特殊なエンベディング モデルが含まれます。 このツールは、選択した入力様式に適した事前トレーニング済みのエンベディング モデルをサポートしています。

衛星画像や航空画像などの画像に基づく入力の場合、モデルはピクセル データを処理して視覚パターン、空間構造、コンテキスト上の関係を学習し、未加工のピクセル値ではなく画像や領域のセマンティック コンテンツを表すエンベディングを生成します。 視覚言語モデルまたはマルチモーダル モデルを使用する場合、画像とテキストは共有埋め込み空間に投影され、自然言語画像検索やモーダル間の類似比較を実現できます。
位置に基づく入力の場合、モデルはフィーチャ ジオメトリーなどの地理情報を、土地利用パターン、密度、テレイン、近接関係といった空間特性を捉えるエンベディングに変換します。 地理コンテキストが類似している位置はエンベディング空間内で近くに配置されるため、属性の一致だけでなく、空間的意味論に基づいた類似解析を実現できます。
テキストに基づく入力の場合、説明やメタデータなどのテキスト フィールドは、意味論的意味を捉えるエンベディングに変換されます。 これにより、自然言語によるクエリー、フィーチャ説明のセマンティック比較、空間解析ワークフローへのテキスト情報の統合をサポートします。
すべての様式を通じて、エンベディングはセマンティック類似性を保持します。つまり、視覚、空間、またはテキストの意味が類似している入力は、エンベディング空間内で互いに近いベクターを生成します。 これにより、ArcGIS Pro 内で類似検索、クラスタリング、取得、フィーチャ ランキング、予測モデリングを行うことができ、意味論ドリブンの空間解析のための統合基盤が提供されます。
AI モデルを使用したエンベディングの生成
AI モデルを使用したエンベディングの生成 ツールを使用して、事前トレーニング済みのエンベディング モデルまたは基盤モデルから空間データのエンベディングを生成できます。 このツールは、モデルのトレーニングやラベル付きデータを必要としません。 代わりに、事前トレーニング済みモデルを適用して、未加工の空間入力やテキスト入力を、意味論的意味を捉えた固定長のエンベディング ベクターに変換します。
これらのエンベディングは、以下を含む下流のエンベディングに基づくワークフローで使用できます:
類似検索
空間クラスタリング
回帰および分類モデル
位置に基づくパターン解析
テキストに基づく空間解析
エンベディングを高度なセマンティック フィーチャとして使用することで、後続の解析タスクで汎用性が向上し、手作業によるフィーチャ エンジニアリングの必要性が軽減されることがよくあります。
ツールの仕組み
このツールは、ラスター画像、地理フィーチャ、テキスト属性などの空間入力データを取り込みます。 選択したエンベディング モデルは入力データを処理し、セマンティック エンベディングを生成します。 その後、エンベディングは再利用のために出力フィーチャクラスに書き込まれます。
ラスター入力
ラスター画像の場合、エンベディングは規則的な空間グリッド上に生成されます。 各グリッド セルは定義された地表エリアを表し、その領域内のセマンティック コンテンツを要約した単一のエンベディングを生成します。
フィーチャ入力 (位置)
地理フィーチャの入力の場合、ツールは次の処理を行います:
フィーチャごとに直接エンベディングを生成できます。
SHAPEフィールド (ジオメトリー) を使用して空間コンテキストを生成します。各フィーチャは、その空間的意味論を表す単一のエンベディングを受け取ります。
テキスト フィールド入力
テキスト フィールドを指定すると、ツールは次の処理を行います:
選択したテキスト属性が、事前トレーニング済みのテキスト エンベディング モデルを使用して処理されます。
各レコードは、そのテキスト コンテンツから生成されたセマンティック エンベディングを生成します。
テキスト エンベディングは単独で使用することも、マルチモーダル ワークフローで空間エンベディングと組み合わせることもできます。
出力エンベディング フィーチャクラス
生成されたエンベディングは、以下を含む出力フィーチャクラスに書き込まれます:
エンベディング以外の元の属性。
esriFieldTypeBlob として保存された専用
Embeddingフィールド。
エンベディングは再利用可能なベクター表現として保存されるため、再生成することなく、下流のエンベディングに基づく解析ツールで効率的に使用できます。
エンベディングの格納形式
エンベディングは固定精度の Float32 ベクターとして表現され、Embedding という名前の BLOB (Binary Large Object) フィールドに保存されます。 ディスク上の正規表現は、リトルエンディアン IEEE-754 32 ビット浮動小数点数 (<f4) としてエンコードされ、エレメント順 (インデックス 0、1、...、D-1) に連続して保存されたエンベディング値を含む未加工のバイト シーケンスです。 この形式はコンパクトで読み書きが高速であり、特定の言語に依存しません。任意のランタイムを、BLOB バイトをリトルエンディアンの float32 値として解釈し、ベクターを再構築できます。
エンベディングのディメンション D はモデルごとに固定されているため、期待されるペイロード サイズは D * 4 バイトになります。 エンベディングを JSON や ArcGIS Feature Service REST API などのテキストのみのチャネル経由で送信する必要がある場合は、同じバイナリー ペイロードが Base64 文字列として転送されます。 明示的なリトルエンディアン float32 規格以外に、プラットフォーム固有の構造体レイアウトや言語固有の直列化は想定されていません。
ベスト プラクティス
このツールを使用する際に考えられるベスト プラクティスを次に示します。
画像用のエンベディング グリッド サイズの選択
ラスター画像からエンベディングを生成する場合、グリッド サイズ パラメーターは各エンベディングによって要約される地表エリアを制御します。 類似検索はこれらのエンベディングに対して実行されるため、グリッド サイズはオブジェクトがどれくらい正確に表現され、一致するかに影響します。
ターゲット オブジェクトに対してグリッド サイズが大きすぎると、複数のフィーチャや周囲の背景が単一のエンベディングに結合される可能性があります。 これにより、類似性の応答が広範囲になり、境界の精度が低下する可能性があります。 グリッド サイズが小さすぎると、オブジェクトが多数のエンベディング セルに断片化される可能性があり、全体的な構造よりも局所的なテクスチャーが強調される場合があります。
一般的に、対象オブジェクトが単一のエンベディング セル内に収まっている場合よりも、複数のエンベディング セルにまたがっている場合に効果的な結果が得られます。 これにより、構造の詳細とコンテキストの完全性のバランスを取るのに役立ちます。
グリッド サイズの影響の解釈

上記の例で、1.4 メートルのグリッド サイズを使用して生成されたエンベディングは、複数のセルにまたがる車両の構造を保持しており、厳密に局所化された類似性の一致を生み出します。 2.8 メートルのグリッド サイズでは、各エンベディングがより広いエリアを要約するため、コンテキストがより混在するようになり、より広範な類似性パターンになります。
オブジェクトのサイズ、画像の解像度、解析の目的はさまざまであるため、最適なグリッド サイズは存在しません。 識別するフィーチャの縮尺と構造の複雑さに沿ったグリッド サイズを選択する必要があります。 複数のグリッド サイズをテストし、類似性パターンを比較することで、ワークフローに最適な構成を決定できます。