概览 #
治理中心以“服务”为维度,进行了服务的信息统计、运行状态观测、治理策略调整等。通过“概览”模块,我们可以看到整个平台服务运行的大体情况,包括
- 当前的事件概览,如:近期是否发生过值得关注的事件。
- 治理事件概览,用于分析指定时间内的事件发生情况。
- 高频事件服务排名,用于定位到经常发生预警的服务,一般此类服务需要重点关注。当前包含
- CPU资源预警排名
- 内存资源预警排名
- 服务下线排名
- 限流服务排名
- 熔断服务排名
最佳实践 #
- 进入治理中心后,关注运行概览的各待处理事件,即页面中标红的部分。点击各项事项指标后进一步排查问题。
- 通过治理概览,我们可以查看系统的治理事件趋势。我们可以查看其是否有规律性来辅助排查问题,如:是否总是在某个时间点触发事件。
- 通过 TopN 的几个卡片,我们可以定位瓶颈服务。
- 定位到瓶颈服务或时间规律后,我们可以对具体的服务设置治理规则。目前支持的服务治理有:熔断、限流。
- 排障时,牢记服务遥测的三大支柱:Logs、Traces、Metrics,有效结合可以取得事半功倍的效果。Traces 聚焦服务的上下游关系,Metrics 显示服务的具体表现指标,如服务负载、服务延时,Logs则记录了服务在具体时间点的更详细的情况。
整个模块的概览如下所示:

整体运行情况 #

这里列出了最近24小时的事件数,以及各类事件的具体数量。通过点击具体的数值,我们可以查看更多的事件信息。
治理概览 #

治理概览汇总了各类事件在近期时间点上的分布情况,可方便我们进一步查看相关事件的时间分布规律,进而进一步定位问题。
资源预警 TopN #
通过对触发预警的服务进行 TopN 排序,我们可以定位到“瓶颈服务”或“需要关注”的服务。这样可以方便我们有针对的进行服务治理。

更改TopN的具体数量
以下为具体支持的 TopN 指标项,包括:
- CPU资源预警排名
- 内存资源预警排名
- 服务下线排名
- 限流服务排名
- 熔断服务排名


