文章

SRE 稳定性工程总览

SRE 稳定性工程总览

一句话:SRE 不是”运维升级版”,而是用工程化手段把不确定性管理到可量化——用 SLO 定义”多稳才算稳”,用错误预算决定”能不能发版”,用 MTTR/MTBF 度量”故障恢复能力”,用 RCA 闭环”从故障中学习”。

为什么需要这篇总览

你的 vault 已有大量 SRE 相关碎片,但散落各处:

  • SLO SLI 错误预算与智能告警 — SLO 体系,但只是稳定性度量的一环
  • K8s 故障排查方法论 — 排查框架,但偏 K8s 操作层
  • 02-Issues/ — 6 篇实战故障记录,缺系统性复盘方法论
  • 可观测性知识总览 — 监控底座,但没连到故障管理闭环

本篇把这些串成一条线:度量 → 检测 → 响应 → 恢复 → 复盘 → 改进,每一环都有对应的笔记。

稳定性工程全景图

graph TD
    subgraph 度量层
        SLO[SLO/SLI/错误预算]
        MTTR[MTTR/MTBF 度量]
    end
    subgraph 预防层
        CAP[容量规划]
        HA[高可用架构]
        CHG[变更管理]
        CHAOS[混沌工程]
    end
    subgraph 检测层
        MON[监控告警]
        ANOM[异常检测]
    end
    subgraph 响应层
        ONCALL[On-Call/值班]
        INC[故障生命周期]
        RUN[应急预案/Runbook]
    end
    subgraph 恢复层
        RCA[根因定位]
        HEAL[故障自愈]
        DR[灾备容灾]
    end
    subgraph 改进层
        POST[无指责复盘]
        ACT[Action Items 跟踪]
    end
    SLO --> MON
    MTTR --> POST
    CAP --> HA
    HA --> CHAOS
    CHG --> INC
    MON --> ONCALL
    ANOM --> ONCALL
    ONCALL --> INC
    INC --> RCA
    RCA --> HEAL
    INC --> DR
    RCA --> POST
    POST --> ACT
    ACT --> CAP
    ACT --> HA
    ACT --> CHG

SRE 核心原则(Google SRE 提炼)

原则一句话对应笔记
追求可持续的可靠性不是 100% 可靠最好,而是”用户满意的最低可靠性 + 差额用于创新”SLO SLI 错误预算与智能告警
量化驱动没有数据就没有决策——SLI 度量用户体验,SLO 设定目标MTTR 与 MTBF 体系详解
减少琐事(Toil)重复、自动化、无长期价值的运维工作必须消灭SRE 工具链总览
事故响应优于预防接受故障必然发生,把 MTTR 压到最低故障生命周期管理
无指责复盘复盘找系统漏洞,不找人背锅无指责复盘与故障分析方法论
错误预算驱动发布预算充足→发版;预算耗尽→冻结变更管理全流程

三层防御体系

第一层:预防(减少故障发生频率 → 提升 MTBF)

手段做法笔记
变更管控灰度发布、评审机制、冻结窗口变更管理全流程
容量规划压测推演、资源预留、弹性伸缩容量规划方法论
高可用架构冗余、多活、故障转移高可用架构设计总览
混沌验证主动注入故障,验证恢复能力混沌工程与故障注入
代码质量CI/CD 门禁、自动化测试CI-CD 最佳实践与安全

第二层:检测与响应(降低故障影响时间 → 降低 MTTR)

手段做法笔记
监控告警黄金信号 + SLO 燃烧率告警SLO SLI 错误预算与智能告警
异常检测时序异常检测、AIOps 智能告警AIOps 实践与智能运维
On-Call分级响应、升级策略、RunbookOn-Call 体系与值班机制
故障生命周期检测→响应→缓解→恢复→复盘故障生命周期管理
应急预案预案管理、演练、红蓝对抗应急预案与故障演练

第三层:恢复与改进(从故障中学习 → 持续提升)

手段做法笔记
根因定位5-Whys、故障树、时间线还原根因定位方法论
故障自愈自动恢复、自愈策略故障自愈与自动恢复
灾备容灾RTO/RPO、备份恢复、多活灾备与容灾方案
无指责复盘Blameless Postmortem、Action Items无指责复盘与故障分析方法论

关键指标体系

graph LR
    subgraph 可靠性指标
        MTBF[MTBF<br/>平均故障间隔时间]
        MTTR[MTTR<br/>平均恢复时间]
        MTTD[MTTD<br/>平均检测时间]
        MTTA[MTTA<br/>平均响应时间]
        MTTI[MTTI<br/>平均定位时间]
    end
    MTBF -->|提升| FREQ[降低故障频率]
    MTTD -->|缩短| DETECT[更快发现问题]
    MTTA -->|缩短| RESP[更快响应]
    MTTI -->|缩短| LOCATE[更快定位根因]
    MTTR = MTTD + MTTA + MTTI + MTTR_restore
指标全称含义优化方向
MTBFMean Time Between Failures两次故障之间的平均时间冗余、变更管控、混沌验证
MTTRMean Time To Recovery/Repair从故障发生到完全恢复的平均时间缩短检测→响应→定位→恢复
MTTDMean Time To Detect从故障发生到被监控告警发现的时间监控覆盖率、异常检测
MTTAMean Time To Acknowledge从告警到 On-Call 人员开始响应的时间告警路由、值班机制
MTTIMean Time To Identify从开始响应到定位根因的时间排查方法论、工具链
MTTR_restoreMean Time To Restore从定位根因到完全恢复的时间自愈、回滚、应急预案

核心公式MTTR = MTTD + MTTA + MTTI + MTTR_restore。优化 MTTR 要分解到每个子环节,不能只看总数字。

与已有知识库的关联

已有笔记在稳定性体系中的角色
可观测性知识总览检测层底座——Metrics/Logs/Traces
SLO SLI 错误预算与智能告警度量层核心——SLO + 燃烧率告警
Metrics 与 Prometheus 实战检测层工具——指标采集与查询
Grafana 可视化与告警检测层工具——可视化与告警
K8s 故障排查方法论定位层方法——K8s 场景的排查框架
CI-CD 最佳实践与安全预防层——变更管控
Terraform 生产级实践预防层——IaC 基础设施
企业级多智能体设计实战改进层——AI 辅助运维
kagent 详解恢复层——K8s Agent 框架
02-Issues/ 故障记录改进层——实战复盘素材

学习路线

  1. 建立度量体系:SLO/SLI → MTTR/MTBF → 指标看板
  2. 补齐方法论:RCA → 无指责复盘 → 故障生命周期
  3. 建设预防能力:变更管理 → 容量规划 → 高可用架构 → 混沌工程
  4. 建设响应能力:On-Call → 应急预案 → 故障自愈 → 灾备容灾
  5. AI 赋能:SRE Agent → AIOps → LLM 辅助 RCA

概念速查

术语含义
SRESite Reliability Engineering,站点可靠性工程
SLIService Level Indicator,服务等级指标(可量化)
SLOService Level Objective,服务等级目标(SLI 的门槛)
SLAService Level Agreement,服务等级协议(对外承诺,违反有赔偿)
Error Budget错误预算 = 1 - SLO,用于平衡可靠性与创新速度
Toil琐事——重复的、可自动化的、无长期价值的运维工作
Blameless Postmortem无指责复盘——找系统漏洞不找人背锅
Runbook操作手册——标准化的故障处理步骤
On-Call值班——随时响应告警的轮换机制
RCARoot Cause Analysis,根因分析
RTORecovery Time Objective,恢复时间目标(允许的最大停机时间)
RPORecovery Point Objective,恢复点目标(允许的最大数据丢失量)
Chaos Engineering混沌工程——主动注入故障验证系统韧性
Incident事件——影响服务正常运行的问题
SEVSeverity,严重程度分级(SEV1 最高)

参考资源

SRE 知识体系笔记索引

核心方法论

笔记核心内容关联JD
SRE 稳定性工程总览MOC 总览,三层防御体系,指标体系整体框架
SRE-SLI-SLO-ErrorBudget实战手册SLI 工作坊模板、多窗口烧钱率告警、Error Budget PolicyJD-1
SRE-从零到一实施路线图五阶段实施清单、Gantt 时间线、验收标准、技术选型JD-1/2/3
MTTR 与 MTBF 体系详解MTTR 四子指标分解,度量建设,Grafana看板JD-1
根因定位方法论 (RCA)5-Whys/FTA/时间线还原/假设排除JD-2
无指责复盘与故障分析方法论无指责原则,Postmortem模板,鱼骨图,Action闭环JD-2

架构与规划

笔记核心内容关联JD
容量规划方法论压测分层,容量模型,趋势预测,HPAJD-2
高可用架构设计总览RTO/RPO,冗余设计,故障转移,降级容错JD-2
弹性伸缩策略HPA/VPA/KEDA/Cluster AutoscalerJD-2
变更管理全流程变更分类,评审Checklist,Argo Rollouts,GitOpsJD-3

故障管理

笔记核心内容关联JD
故障生命周期管理检测→响应→分级→恢复→复盘→改进JD-2
On-Call 体系与值班机制轮换模式,告警分级路由,Runbook,升级策略JD-3
故障自愈与自动恢复自愈层次模型,Runbook引擎,安全护栏JD-2/3
应急预案与故障演练预案模板,红蓝对抗,Game Day,度量JD-2/3

工具与韧性

笔记核心内容关联JD
SRE 工具链总览全景图,选型表,建设路线,Runbook脚本JD-3
混沌工程与故障注入ChaosMesh,故障注入类型,实验流程,安全护栏JD-2
灾备与容灾方案容灾L1-L6,Velero,PITR,同城双活,异地多活JD-2

AI 赋能运维

笔记核心内容关联JD
SRE Agent 运维落地实践Agent架构,告警分析,故障诊断,RAG,权限模型JD-4
AIOps 实践与智能运维异常检测算法,告警降噪,根因推断,容量预测JD-4
LLM 辅助 RCA 与日志分析日志聚类,5-Whys推理,NL-to-PromQL,RAG增强JD-4

状态

  • 总览 MOC
  • SLI-SLO-Error Budget 实战手册(2026-08-04)
  • 从零到一实施路线图(2026-08-04)
  • MTTR 与 MTBF 体系详解
  • 根因定位方法论 (RCA)
  • 无指责复盘与故障分析方法论
  • 故障生命周期管理
  • On-Call 体系与值班机制
  • 容量规划方法论
  • 高可用架构设计总览
  • SRE 工具链总览
  • 变更管理全流程
  • 混沌工程与故障注入
  • 灾备与容灾方案
  • 弹性伸缩策略
  • 故障自愈与自动恢复
  • 应急预案与故障演练
  • SRE Agent 运维落地实践
  • AIOps 实践与智能运维
  • LLM 辅助 RCA 与日志分析