Skip to content
← Back to job listings

SRE稳定性工程师

geely · 钱塘区, 浙江, 中国

External listingfull-timeabout 2 months ago

About The Role

岗位职责: 1. 系统稳定性建设:统筹全局系统稳定性建设,制定SLA、MTTR、故障率、变更成功率等核心指标,并推动持续改进。 2. 变更管控体系:负责变更管控体系建设,推动灰度发布、风险评估、回滚预案、变更复盘等机制在研发与运维团队的落地。 3. 故障管理运营:负责事件/故障管理运营,组织应急响应、根因分析与复盘改进,推动故障管理从“被动处理”向“主动预防”转型。 4. 可观测性建设:推进核心业务与系统的监控告警建设,构建全链路可观测性体系,提升问题发现与定位效率。 5. 混沌工程与演练:常态化推进红蓝对抗与故障演练,建设“蓝军”能力,验证高可用架构及容灾预案的有效性。 岗位要求: 1. 本科及以上学历,计算机相关专业,5年以上SRE或运维开发经验,具备大型系统稳定性保障或高可用架构治理实战经验。 2. 深入理解故障管理、变更管控、容量规划、容灾治理、应急恢复等SRE核心方法论,有体系化建设与推行经验。 3. 熟悉云平台、微服务、云原生架构,深入理解主流中间件(如MySQL、Redis、Kafka等)的技术原理与高可用调优。 4. 熟悉可观测性建设方法及技术(如Prometheus、Grafana等),有全链路压测或故障演练实操经验者优先。 5. 具备数据化运营思维,能够通过分析故障、告警、容量、变更等数据,精准识别系统性风险并推动闭环治理。 6. 具备出色的跨团队沟通协调与项目推动能力,逻辑思维严谨,Owner意识强,能在复杂高压环境下拿结果。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing