Skip to content
← Back to job listings

智能驾驶云资源运维工程师

voyah · 汉阳区, 湖北, 中国; 上海市, 上海市, 中国

External listingfull-timeabout 1 month ago

About The Role

核心岗位职责 1.负责 A800/H20 等大规模异构 GPU 集群的日常运维、调度优化与故障排查,提升算力利用率与训练任务成功率,保障分布式训练稳定运行。 2.负责大规模 Kubernetes 集群架构运维、性能调优与高可用保障,解决网络拥塞、节点雪崩、存储 IO 瓶颈等复杂问题,支撑智驾业务云原生化落地。 3.负责 PB 级智驾训练数据的存储运维,优化对象存储与高性能并行文件系统的读写性能,解决数据加载瓶颈,落地冷热数据分层与成本优化。 4.统筹公有云、运营商云的全品类资源全生命周期管理,负责算力成本核算、对账分析与降本落地,通过资源优化、调度策略提升利用率、降低运营成本。 5.搭建全栈监控告警体系,负责生产故障应急处理与复盘优化;落地智驾敏感数据加密、脱敏与 IAM 精细化权限管控,满足行业合规要求。 6.负责云资源与算力成本的全链路管控,包括成本核算、预算拆解、月度对账与分析报表输出,定位成本异常项并推动业务侧优化。 技能要求 1.精通主流公有云(火山引擎、阿里云等)产品架构与运维,有多云管理经验; 2.精通 Kubernetes 核心原理与运维,能独立排查大规模集群的网络、存储、调度类复杂故障; 3.熟悉 NVIDIA GPU 驱动、CUDA 环境与 RDMA 高性能网络,理解分布式 AI 训练的算力需求; 4.熟练使用 Python/Go/Shell 至少一种语言,能独立开发自动化运维工具; 5.熟悉 Prometheus/Grafana 监控体系,掌握 Ansible、Terraform 等自动化工具; 6.具备成本意识与数据分析能力,有云成本优化、数据安全合规落地经验优先。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing