メトリクス API を理解する
メトリクス API を使用すると、アプリケーションとインフラストラクチャーを監視、管理して、可観測性を向上させることができます。 メトリクス API を使用すると、リアルタイムにデータを収集、集約でき、システムのパフォーマンスを把握できるようになります。 また、DevOps チームは、メトリクス API を使用して、アラートを設定し、問題を解決して、リソース割り当てを最適化できます。 これらのパフォーマンス指標を公開することで、異常とボトルネックが検出しやすくなり、システム保守を積極的に行えるようになります。 最後に、メトリクス API では、幅広い監視ツールと可視化ツールを統合して、複雑なシステムを監視する能力を強化できます。
管理者は、メトリクスへのアクセスを構成後、PromQL クエリーを使用して、サードパーティーのビューアーやグラフィカル アプリケーション (Grafana など) で使用できるメトリクス情報を入手できます。
メトリクスの使用例
メトリクスは、ArcGIS Enterprise デプロイメントの設計、保守、トラブルシューティング、評価を行うためのさまざまな用途を可能にします。
使用状況およびアクティビティーのパターンを特定する
使用状況およびアクティビティーのパターンは、人が ArcGIS Enterprise にどのようにかかわっているかを示します。 これは、ArcGIS Enterprise 組織内での影響を計測、伝達する必要があるビジネス マネージャーや GIS マネージャーにとって有用な情報です。
1 秒あたりのリクエストは、サービス、ユーザー、操作ごとにグループ化できます。 これにより、最も広く使われているサービス、各ユーザーがかかわるサービス、ユーザーがさまざまなサービスで行っている操作のタイプを特定できます。 この情報は、拡散または削除するコンテンツの選択や、各ユーザーに対する適切なライセンスとアクセス権限の選択に影響する可能性があります。
システムの問題を検出、理解、解決する
システムの状態を理解することは、ArcGIS Enterprise の適切な機能を確実にする責任を負った GIS および IT 管理者にとって役立ちます。
稼働時間 - システムが稼働しているか停止しているかは、最も重要な主要業績評価指標です。 ユーザーがシステムに関する問題を報告した場合はまず、稼働時間をチェックしてシステムが使用可能かどうかを確認します。
サービス エラー率 - エラー率は、サービスがエラーを返す頻度についての情報を提供します。 このメトリクスは、エラー率を特定の閾値以下に保つ必要があるサービス品質保証 (SLA) がある場合、特に重要です。
応答時間 - ユーザーは、応答が遅いサービスに対して敏感になることがあります。 応答時間が長い場合は、根本的な問題があることを示している可能性もあります。 サービス名、ユーザー、操作の組み合わせで応答時間をグループ化すると、遅い応答時間の原因を特定するのに役立ちます。
サービス負荷 - 一部の問題は、高いサービス負荷に関連しています。 1 秒あたりのリクエストやサービス使用時間の急増は、1 つのサービスが大量のリクエストを処理する必要があることが、システムの問題を引き起こしている可能性を示しています。
コンピューターおよびプロセスのリソース使用量 - メモリー、CPU、ディスクの使用量に関する情報を使用して、システムの問題がリソース使用量の多さに関連しているかどうかを調べられます。 使用量をプロセスごとに分割すると、どのプロセスがシステム リソースの使用量を増やしているかを特定できます。
デプロイメントの調整
現在システムが順調に稼働していても、システムを最適化し、将来問題が発生するリスクを減らすため、構成を調整することをおすすめします。
サービス負荷 - サービスがシステムに与える影響は、サービスが使用した時間 (秒/秒) で最も適切に計測されます。 負荷の高いサービスを知ることで、調整改善の最適なターゲットを特定できます。
プロセス リソース使用量 - 個々のプロセスのメモリーと CPU の使用量は、全体のリソース使用量に最も大きな影響を与えているシステムの部分を特定するのに役立ちます。
適正サイズのインフラストラクチャー リソース
インフラストラクチャーはコストがかかる可能性があるため、必要な容量を供給できる十分なリソースを確保し、不要なアイドル状態のリソースのコストをなくすことが重要です。
情報 - この情報は、すべてのコンピューターのオペレーティング システム、CPU、メモリーなどの仕様を、一括して詳細に示します。 これは、コンピューターの仕様を確認し、ArcGIS Server サイト内のすべてのコンピューターについて仕様がシステム要件を満たし、一貫していることを確実にする便利な方法です。
コンピューター リソースの使用量 - メモリー、CPU、ディスクの使用率が常に高い場合は、ニーズに合わせてインフラストラクチャーを拡張する必要があるかもしれません。 逆に、リソースが十分に活用されていない場合は、パフォーマンスに悪影響を及ぼさずにインフラストラクチャーへの投資を削減できる可能性を示しています。
使用可能なメトリクス
ArcGIS Enterprise のコンポーネントには、メトリクス API を通じてさまざまなタイプのメトリクスがあります。 コンピューター メトリクスは、使用可能メモリーなど、コンポーネントがインストールされているコンピューターに関する情報を提供します。 サービス メトリクスは、応答時間など、サービス パフォーマンスに関する情報を提供します。 各タイプのメトリクスに関する詳細は、「メトリクス API によって公開される情報」をご参照ください。
このリリースでは、ArcGIS Enterprise のすべてのコンポーネントがメトリクス API を公開しているわけではありません。 次の表は、異なるコンポーネントに対して使用できるメトリクスのタイプをまとめたものです。
|
コンポーネント |
使用可能なメトリクス |
|---|---|
|
Portal for ArcGIS |
|
|
ArcGIS Data Store |
|
|
ArcGIS Server ベースのサーバー:
|
|
メトリクスの消去
メトリクスは、ArcGIS Enterprise に関する膨大な情報を収集します。 古くなったメトリクスは、デフォルトで 1 時間ごとにシステムから消去されます。 メトリクスの消去間隔をデフォルトより長くすることもできますが、応答サイズが大きくなる可能性があります。 ほとんどの組織では、デフォルトの間隔で適切なバランスが取れるので、変更する必要はありません。
次の両条件が該当する場合に限り、デフォルトの消去間隔を長くすることをおすすめします:
Prometheus メトリクスを 1 時間を上回る間隔でスクレイピングして集約するカスタム ジョブがあります。
サービスのカーディナリティーは高くありません。 多くのユーザーが多くのサービスに定期的にアクセスしている場合は、カーディナリティーが高くなります。
データの損失を防ぐため、消去間隔が Prometheus のジョブ構成で定義されたスクレイピング間隔より長いことを確認してください。