← Back to job listings
MO
机器学习平台工程师(Kubernetes / GPU 基础设施方向)
moonshot · 南山区, 广东, 中国; 海淀区, 北京市, 中国
About The Role
岗位职责 设计并维护支撑大模型训练/推理的 Kubernetes 平台,负责集群生命周期管理、节点治理、网络/存储 CSI 插件及自动化运维体系; 深度优化容器镜像分发,将千节点集群的 Pod 启动时间压缩到秒级; 研发平台化工具链(CLI/SDK/Web Console),覆盖实验管理、模型管理、数据集编排、工作流流水线(MLOps),降低算法工程师的使用门槛; 建设集群可观测性与成本治理体系,通过 eBPF/Prometheus 实现训练任务级资源画像与异常诊断。 岗位要求 计算机相关专业,3 年以上分布式系统或基础设施开发经验; 精通 Go,具备扎实的操作系统、网络、存储基础; 深度掌握 Kubernetes 生态(Scheduler/Operator/CRD/CSI/CNI),有 500+ 节点生产集群运维或二次开发经验; 熟悉 Linux 容器技术(containerd/runc/cgroup/seccomp),具备 GPU 服务器集群运维经验。 加分项 有 K8s 调度器(Scheduler Framework / Volcano / Koordinator)源码级开发或社区贡献; 熟悉 GPU 拓扑感知调度、MIG/MPS 虚拟化、显存/算力分时复用; 具备大规模集群(1000+ 节点)自动化运维、故障自愈、多地域容灾经验。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring