SRE 工程师(容器 & 稳定性方向)
geely · 萧山区, 浙江, 中国
About The Role
【岗位职责】 负责公司 K8s 容器集群全生命周期运维,包含集群部署、扩缩容、故障排查、资源调度与容器安全管控; 搭建完善发布体系,设计灰度发布、蓝绿发布、回滚机制,统一应用发布流程,实现发布自动化与风险可控; 搭建、优化全链路监控体系(指标、日志、链路、告警),完善告警收敛、根因定位能力,降低线上故障发生率; 线上业务性能专项优化:服务器、中间件、网络、容器资源瓶颈分析,压测落地,制定性能基线与优化方案; 推动运维流程规范化:制定变更规范、故障复盘标准、应急预案、容量规划制度,沉淀运维 SOP; 7*24 线上应急值守,快速处理容器、集群、业务层故障,输出复盘报告并落地改进措施; 持续优化资源成本,提升集群资源利用率,推动基础设施自动化运维改造。 【任职要求】 2 年及以上 SRE / 容器运维实战经验,精通 Kubernetes 完整生态(Pod/Deployment/Service/Ingress/CRD 等); 熟练使用 Prometheus、Grafana、ELK、SkyWalking 等监控链路工具,具备监控平台自建与调优经验; 熟悉 CI/CD 发布流程,能基于 GitLab CI/Jenkins/ArgoCD 搭建自动化发布流水线; 掌握 Linux 性能排查工具(top/iotop/strace/perf 等),具备线上压测、性能调优落地经验; 熟悉 Shell/Python/Go 至少一门开发语言,可独立编写运维自动化脚本; 具备规范化运维思维,有制定运维标准、故障处理流程、容量规划落地经验优先; 熟悉云原生网络、存储、安全,有大规模线上集群运维、故障处理经验优先。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring