07-马千里-可观测系统的多机房实践.pdf
1、可观测系统的多机房实践小米 马千里大纲能力现状架构介绍关键问题当前工作能力现状能力现状架构介绍监控架构还保留有 Open-Falcon 的元素,比如Falcon Agent、Transfer、Judge。增加了 Prometheus 相关的能力。将 Open-Falcon 的 Alarm 提取为告警平台。VMgatewayInsert 和 VMgatewaySelect 为自研组件,起到代理和主备切换的作用。VM 在各机房本地化部署,双 AZ 部署。日志架构底层以 ES 为主要方案。Loki 用作冷备存储,同时在多个场景有深度使用。ES、Loki 在各机房本地化部署。告警接入告警平台。链路架构
2、应用:“应用”来自不同的平台,包括主机、容器平台、Flink 等。应用中心:在应用元数据基础上,提供的应用的管理能力。Sampling-Trace-ETL:尾采样。只保留异常、慢查相关的 trace。性价比高。Metric-Trace-ETL:服务端计算指标。优点是和客户端语言解耦,不足是会在指标产生额外的维度,有高基数的风险。底层以 ES 为主要方案,在各机房本地化部署。告警架构从 Open-Falcon 的 Alarm 演化而来。增加了“告警源”,以及相关样式、策略的抽象。告警服务只在国内部署,各机房的告警事件统一回国发送。为了应对专线故障,开通了公网的加密链路,作为备用通道。设计之初,参
3、考了 PagerDuty、FlashDuty 等产品。致敬。关键问题问题一:大文件 merge 导致查询超时简介现象:查图功能异常。原因:VM 的文件合并没有被有效限制,大文件 merge 导致严重写放大,单个节点负载升高,集群的查询请求被间接 delay 并超时。方案故障期间将查询切换到备用集群更新 VM 版本增加告警,比如 vm_actived_merge 告警问题一:大文件 merge 导致查询超时排查1.单个节点的刷盘线程数达到 CPU 核数限制(45 核);该节点请求延迟严重,锁定故障节点。VM 查询需要等到所有节点返回结果,单个节点故障会导致整个集群查询超时。2.vmselect





点击查看更多