概览

概览 #

治理中心以“服务”为维度,进行了服务的信息统计、运行状态观测、治理策略调整等。通过“概览”模块,我们可以看到整个平台服务运行的大体情况,包括

  • 当前的事件概览,如:近期是否发生过值得关注的事件。
  • 治理事件概览,用于分析指定时间内的事件发生情况。
  • 高频事件服务排名,用于定位到经常发生预警的服务,一般此类服务需要重点关注。当前包含
    • CPU资源预警排名
    • 内存资源预警排名
    • 服务下线排名
    • 限流服务排名
    • 熔断服务排名

最佳实践 #

  1. 进入治理中心后,关注运行概览的各待处理事件,即页面中标红的部分。点击各项事项指标后进一步排查问题。
  2. 通过治理概览,我们可以查看系统的治理事件趋势。我们可以查看其是否有规律性来辅助排查问题,如:是否总是在某个时间点触发事件。
  3. 通过 TopN 的几个卡片,我们可以定位瓶颈服务。
  4. 定位到瓶颈服务或时间规律后,我们可以对具体的服务设置治理规则。目前支持的服务治理有:熔断、限流。
  5. 排障时,牢记服务遥测的三大支柱:Logs、Traces、Metrics,有效结合可以取得事半功倍的效果。Traces 聚焦服务的上下游关系,Metrics 显示服务的具体表现指标,如服务负载、服务延时,Logs则记录了服务在具体时间点的更详细的情况。

整个模块的概览如下所示:

image-20211013144116727

整体运行情况 #

image-20211013144720003

这里列出了最近24小时的事件数,以及各类事件的具体数量。通过点击具体的数值,我们可以查看更多的事件信息。

治理概览 #

image-20211013144817998

治理概览汇总了各类事件在近期时间点上的分布情况,可方便我们进一步查看相关事件的时间分布规律,进而进一步定位问题。

资源预警 TopN #

通过对触发预警的服务进行 TopN 排序,我们可以定位到“瓶颈服务”或“需要关注”的服务。这样可以方便我们有针对的进行服务治理。

image-20211013145138481

更改TopN的具体数量

以下为具体支持的 TopN 指标项,包括:

  • CPU资源预警排名
  • 内存资源预警排名
  • 服务下线排名
  • 限流服务排名
  • 熔断服务排名

image-20211013144957783

image-20211013145016290

image-20211013145023770