子专栏:性能与可靠性
归属:知识宝典
-
5.4.2 SLO 驱动的告警体系 · 错误预算 + OpenTelemetry 标准化
SLO 驱动告警体系全栈 —— Error Budget 错误预算 + Burn Rate 烧率 + OpenTelemetry 标准化 + 4 大告警工具对比
-
5.4.1 Metrics / Logs / Traces 三支柱 + Prometheus + Grafana + Tempo
可观测性三大支柱 —— Metrics(指标)+ Logs(日志)+ Traces(链路追踪)全栈 + Prometheus + Grafana + Tempo 完整实战
-
5.3.2 故障注入清单(网络/进程/资源/时间)+ 真实案例
故障注入清单全栈 —— 网络/进程/资源/时间 4 大类故障场景 + 真实生产案例 + ChaosBlade / tc / iptables 注入命令
-
5.3.1 Chaos Engineering 原则 + ChaosBlade / Litmus / Gremlin 对比
混沌工程全栈 —— Netflix Chaos Monkey 起源 + ChaosBlade / Litmus / Gremlin 三大工具对比 + 4 大故障类别实战
-
5.2.2 流量染色 / 全链路隔离 / 数据脱敏三件套
测试环境治理三件套 —— 流量染色(请求标记透传)/ 全链路隔离(环境路由)/ 数据脱敏(隐私合规)全栈实战
-
5.2.1 压测工具 · JMeter / Locust / wrk / k6 / Gatling 对比
5 大压测工具全方位对比 —— GUI 协议 / 脚本语言 / 分布式能力 / 性能 / 学习曲线矩阵
-
5.1.2 实战 · 一次「系统卡顿 3 周」的完整排查
一次「系统卡顿 3 周」完整排查实战 —— 问题描述 / 排查过程 / 根因定位 / 修复方案 / 总结
-
5.1.1 USE / RED 方法 · CPU/内存/磁盘/网络四件套
性能分析方法论全栈 —— Brendan Gregg USE / Tom Wilkie RED + CPU/内存/磁盘/网络四大子系统性能分析工具矩阵