Skip to main content

エンベディングのマージの仕組み

エンベディングのマージ ツールを使用すると、ソース レイヤーの高次元ベクター データ (エンベディング) をターゲット ポリゴン レイヤーに集約できます。 このプロセスは複雑な情報を要約するために不可欠であり、未加工の局所的なエンベディングと、管理区画、集水域、カスタム解析グリッドなどの、より大規模で有意義な地理単位との橋渡しをします。

ArcGIS のエンベディングの概要

最新の AI ワークフローでは、エンベディングはそのフィーチャの意味論的意味を捉える、密度の高いフィーチャの高次元表現です。

エンベディングの詳細

ArcGIS Pro では、エンベディングは BLOB フィールドとしてのエンベディング で説明されているように、BLOB (Binary Large Object) フィールドに保存されます。

パフォーマンスと Python、C++、JavaScript との相互運用性を確保するため、ツールを使用するには、これらの BLOB が 32 ビット浮動小数点 (float32) のバイナリー配列として直列化されている必要があります。 ツールが実行されると、これらのバイナリー バッファーが数値配列として直接メモリーに読み取られ、数学的集約が実行された後、出力フィーチャクラスに保存するために再直列化されます。

ディープ ラーニング モデルなどを使用してエンベディングを生成すると、生成されるベクターはその位置の意味論を捉えます。 エンベディングのマージ ツールを使用すると、数学的な整合性を維持しながら、これらのベクターをさまざまな縮尺間で移動させることができます。

テーブル ビューでのエンベディング

ツールによるデータの処理方法

ツールは空間的および数学的な正確度を確保するため、4 段階のワークフローに従います:

空間オーバーレイ

ツールはまず、エンベディング フィーチャ パラメーター値 (ソース) と ターゲット フィーチャ パラメーター値 (終点) との間の正確な空間オーバーラップを判定します。 これにより、ターゲット ポリゴン内に物理的に収まるエンベディングの箇所のみが、その最終的なベクターに寄与するようになります。 ペアワイズ インターセクト ロジックを活用することで、ツールは標準的なオーバーレイ手法よりも効率的に、トポロジーの複雑度が高い大規模なデータセットを処理します。

ポイントの場合、ツールは各ターゲット ポリゴン内に物理的に含まれているポイントを特定します。 ポリゴンの場合、ツールはソース エンベディング ポリゴンがターゲット ポリゴンとオーバーラップする正確なフットプリントである、交差面積を計算します。

集約ロジック

このツールの中心的な機能として、複数の高次元ベクターをターゲット エリアの単一の代表ベクターにマージすることができます。 計算方法は、入力ジオメトリーに基づいて変更されます。

ポイント → ポリゴン (単純平均)

ポイント → ポリゴン

ポイントをポリゴンに集約する場合、ツールは各ポイントが不連続な等重みの観測データを表していることを前提としています。 最終的なベクター \(E_{\text{target}}\) は、境界内にあるすべてのベクターの算術平均 \((E_i)\) です。 これは、ジオタグ付きのソーシャル メディアのエンベディングや、局所的なセンサー データの集約に最適です。

\[ E_{target} = \frac{1}{n} \sum_{i=1}^{n} E_i \]
注意:

ターゲット ポリゴンにポイントが含まれていない場合、出力の Embedding フィールドは NULL 値のままになります。

ポリゴン → ポリゴン (面積加重平均)

ポリゴン → ポリゴン

ソース エンベディングがポリゴンの場合 (衛星画像のパッチ、郡の境界など)、ツールは面積加重内挿を使用します。 このロジックは、ターゲット ポリゴンの 90% をカバーするエンベディングは、10% のみをカバーするエンベディングよりも、結果に対して大幅に高い影響をもたらす必要があることを認識しています。

ツールは、交差面積 (\(Area_i\)) をその特定のターゲット内のオーバーラップ面積の合計で割ることにより、オーバーラップしている各エンベディングの重み (Wi) を計算します。

\[ E_{target} = \sum_{i=1}^{n} E_i \cdot \left(\frac{Area_i}{\sum Area}\right) \]

ベクター計算

NumPy ライブラリーを使用して、ツールはバイナリー BLOB を配列に再構築し、加重計算を実行してから、その結果を保存用のバイナリー形式に再直列化します。

出力の生成

最終的な結果は、新しいフィーチャクラスに書き込まれます。 新しい BLOB フィールド (デフォルト名は Embedding) が作成されます。 この出力は、類似検索 などの後続の GeoAI ツールに最適化されています。

使用法

このセクションでは、ツールを正常に実行するための実用的なヒントと制約について説明します。

データの準備

ツールは、Embedding という名前のフィールドのみを検索します。 ソース フィーチャにこの正確なフィールド名が付与され、データ タイプが BLOB に設定されていることを確認します。

入力内のすべてのエンベディングは、同じ長さである必要があります (例: すべてが 128 次元または 512 次元であること) 。 長さが不一致なエンベディングをツールが検出した場合、それらのレコードをスキップし、警告を発行します。

ワークスペースの制約

シェープファイルや GeoPackage では、大きな BLOB データの保存と取得に関して技術的な制限があるため、出力エンベディング フィーチャ パラメーター値は、ファイル、モバイル、またはエンタープライズ ジオデータベースに保存する必要があります。

大規模なエンベディング データセットは RAM を大量に消費する可能性があるため、このツールでの memory または in_memory ワークスペースの使用はおすすめしません。

環境設定

面積加重平均の計算では、出力座標系環境に投影座標系を使用することを強くおすすめします。 地理座標系 (WGS84) を使用すると、一部の地域でパフォーマンスが低下し、面積比の精度が低下する可能性があります。

トラブルシューティング

出力内のターゲット ポリゴンの Embedding フィールドが NULL 値の場合、ソース フィーチャがそのポリゴンと空間的に交差していないか、交差するフィーチャが空の BLOB データを含んでいたことを意味します。