GKE 可靠性治理
原名:gke-reliability
评估 GKE 工作负载的可用性、故障恢复、容量和发布风险。
中文 Skills 技能说明
适合上线前检查或生产稳定性改进。它会结合 SLO、错误预算、健康检查、Pod 分布、备份和演练记录提出建议;重启、驱逐、扩缩、故障注入和恢复测试不能直接在生产执行,必须有维护窗口、负责人和回退条件。
上游能力依据
上游原始适用说明:Improves GKE workload reliability, using PDBs, health probes, and topology spread constraints. Use when configuring GKE workload reliability, setting up PDBs, or configuring GKE health probes (liveness, readiness, startup). Don't use for disaster recovery setup or full cluster backups (use gke-backup-dr instead).
上游 SKILL.md 主要章节(保留原文标题):
- Golden Path Reliability Defaults
- Workflows
- 1. Verify Cluster High Availability
- 2. Pod Disruption Budgets (PDBs)
- 3. Health Probes
- 4. Graceful Shutdown
- 5. Topology Spread Constraints
- 6. Replicas
- Best Practices & Production Guidelines
使用边界
先核对运行环境、账号、区域、依赖和最小权限。创建资源、改配置、发布服务或产生费用前必须让使用者确认。
作者、翻译与许可证
- 原作者
- 中文翻译
- CEOFans翻译
- 许可证
- Apache-2.0
- 上游来源
- https://github.com/google/skills/tree/8db47666a1307cb838f056ac03193f85c42e2c69/skills/cloud/gke-reliability
适用范围
平台:linux、macos、windows;标签:Google Cloud、Gke、Reliability
安全提示
基础静态扫描不等于绝对安全。技能可能调用命令、浏览器、云服务或本地文件,请在最小权限环境中使用,高风险操作必须人工确认。
如发现侵权、许可证或安全问题,可在本页前台提交投诉,管理员复核后可立即下架。