Skip to main content

了解指标 API

指标 API 通过允许您监控和管理应用程序及基础设施,有助于提高可观测性。 指标 API 实现了实时数据收集和聚合,并提供了有关系统性能的见解。 此外,DevOps 团队可以使用 API 设置警报,解决问题并优化资源分配。 通过公开这些性能指标,可以更好地检测异常和瓶颈,并在系统维护中提高主动性。 最后,指标 API 允许集成各种监控和可视化工具,增强观察复杂系统的能力。

作为管理员,在配置好指标访问权限后,您可以使用 PromQL 查询来获取指标信息,这些信息可被第三方查看器或图形应用程序(如 Grafana)使用。

指标使用案例

指标为设计、维护、故障排除和评估您的 ArcGIS Enterprise 部署提供了多种使用案例。

识别使用情况和活动模式

使用情况和活动模式显示了人们如何与 ArcGIS Enterprise 进行交互。 对于需要衡量并传达 ArcGIS Enterprise 在组织中影响的业务和 GIS 经理来说,这可能是有用的信息。

每秒请求数可以按服务、用户和操作进行分组。 这可以帮助您识别最受欢迎的服务、每个用户使用的服务,以及用户在不同服务上执行的操作类型。 这些信息可以为您提供决策依据,帮助您决定哪些内容应被推广或删除,以及为每个用户分配合适的许可和访问权限。

检测、理解和解决系统问题

了解系统状态可以为负责确保 ArcGIS Enterprise 正常运行的 GIS 和 IT 管理员提供帮助。

  • 正常运行时间 - 系统处于正常运行还是停机状态是最重要的关键性能指标。 如果用户报告系统存在问题,首先检查正常运行时间,以确认系统是否完全可用。

  • 服务错误百分比 - 错误率提供了有关服务返回错误的频繁程度的信息。 如果您有服务级别协议 (SLA),其中明确规定错误率必须保持在一定阈值以下,那么该指标尤为重要。

  • 响应时间 - 用户对响应缓慢的服务可能会比较敏感。 较长的响应时间也可能表明存在需要解决的潜在问题。 通过组合服务名称、用户和操作对响应时间进行分组,有助于确定响应缓慢的原因。

  • 服务负载 - 某些问题与高服务负载有关。 每秒请求数或每秒服务使用时间的快速增加可能表明,系统中的某个问题是由某个服务需要处理大量请求引起的。

  • 计算机和进程资源使用情况 - 内存、CPU 或磁盘使用情况信息使您能够调查系统问题是否与高资源使用率相关。 按进程细分使用情况可以帮助您发现哪些进程导致了较高的系统资源使用率。

优化部署

即使系统当前运行良好,您可能也希望调整其配置以优化系统并降低未来出现问题的风险。

  • 服务负载 - 衡量服务对系统影响的最佳方式是通过该服务每秒占用的秒数(即每秒内用于服务的时间)。 了解哪些服务负载较高,可以让您确定优化改进的最佳目标。

  • 进程资源使用情况 - 单个进程的内存和 CPU 使用情况也可以帮助您识别系统中对整体资源使用影响最大的部分。

调整基础设施资源规模

由于基础设施可能非常昂贵,因此确保您拥有足够的资源来提供所需的容量,同时又不购买不需要的空闲资源非常重要。

  • 关于 - 此信息详细列出了所有计算机的规格,如操作系统、CPU 和内存。 这是一种便捷的审查计算机规格的方法,可确保它们满足系统要求,并且在 ArcGIS Server 站点中的所有计算机上保持一致。

  • 计算机资源使用情况 - 内存、CPU 或磁盘的持续高使用率可能表明您需要扩展基础设施以满足需求。 相反,未充分利用的资源可能表明您可以在不会对性能产生负面影响的情况下减少基础设施支出。

可用指标

ArcGIS Enterprise 的各个组件通过指标 API 报告不同类型的指标。 计算机指标提供有关安装组件的计算机的信息,例如可用内存。 服务指标提供有关服务性能的信息,例如响应时间。 有关每种类型指标的详细信息,请参阅指标 API 公开的信息

在此版本中,并非 ArcGIS Enterprise 的所有组件都公开指标 API。 下表总结了不同组件有哪些类型的可用指标。

组成部分

可用指标

Portal for ArcGIS

  • 计算机指标

  • 组织指标

ArcGIS Data Store

  • 计算机指标

  • 关系存储指标

基于 ArcGIS Server 的服务器:

  • ArcGIS GIS Server

  • ArcGIS GeoEnrichment Server

  • ArcGIS GeoEvent Server

  • ArcGIS Image Server

  • ArcGIS Knowledge Server

  • ArcGIS Workflow Manager Server

  • 计算机指标

  • 服务指标

清除指标

指标会收集关于 ArcGIS Enterprise 的大量信息。 默认情况下,过时的指标会每小时从系统中清除一次。 您可以将清除间隔增加到默认值以上,但这可能会导致响应大小增长。 对于大多数组织来说,默认间隔提供了适当的平衡,您不需要更改它。

仅当以下两个条件同时满足时,才建议增加默认清除间隔:

  • 您有一个自定义作业,它以超过 1 小时的间隔抓取和聚合 Prometheus 指标。

  • 您的服务未表现出高基数。 当有很多用户定期访问很多服务时,就会发生高基数。

为了防止数据丢失,请确保清除间隔长于 Prometheus 作业配置定义的抓取间隔。