通过 ACK 智能化运维体系获得集群自动化诊断和自愈能力.pdf
1、通过 ACK 智能化运维体系获得集群自动化诊断和自愈能力姜继忠阿里云高级技术专家Contents目录01Kubernetes和故障排查02使用AIOps套件诊断K8S故障03托管节点池Kubernetes很简单一键部署应用kubectl apply f nginx.yamlKubernetes也很复杂架构复杂,概念多,学习曲线陡峭配置复杂,易出错生态庞大,涉及众多技术领域Kubernetes运维挑战16.8%24.8%31.9%37.7%48.0%缺乏必要的技能和人才企业IT组织架构和文化遗留系统兼容性问题安全合规问题平台提供方支持力度有限Kubernetes and cloud native
2、 operations report 2022排查故障是Kubernetes用户难以绕过的坎应用层异常和系统层异常业务内部异常K8S层面无异常需要开发人员排查分析应用日志、代码由于配置或其他原因所导致的K8S,OS等层面的异常由业务代码逻辑所导致的异常应用层异常系统层异常非业务代码问题K8S或者更底层的问题需要运维人员排查分析k8S配置、底层资源配置典型的故障排查流程识别问题分析原因查看日志、监控、事件、配置修改配置,观察恢复情况Pod无法启动?节点状态异常?应用网络不通?根据问题,基于经验判断导致问题的可能原因,对于Pod持续Pending问题,可能的原因包括集群没有资源、部署约束不合理、镜
3、像下载失败、网络分配失败等根据分析的可能原因,通过监控、日志进一步定位。定位到问题,修复后观测是否恢复故障排查的挑战技能门槛经验沉淀排查耗时通过AI实现自动化诊断Node云监控SLSKubernetes统一数据模型模块化采集采集数据源指标处理根因分析诊断类型接入Rule EngineKnowledge baseMachine Learning指标管理框架指标注册指标评估复杂指标预处理综合分析声明式规则外部接入持续优化ECS诊断vTrace用户评价知识沉淀诊断结果分析规则库维护问题排查标准流程Node诊断Pod诊断网络诊断容器智能运维CISOpenAPIIngress诊断内存诊断Service诊





点击查看更多