← Back to job listings
CM
AI服务器运维工程师-AI Server Operation and Maintenance Engineer(J16534)
ChangXin Memory (CXMT) · 安徽省·合肥市
About The Role
- 高性能服务器与计算集群部署维护:负责设计、部署和维护支持AI/ML工作负载的高性能服务器和计算集群,确保其稳定性和高效性;
- 服务器运维与应急处理:负责服务器的架构规划、运行维护、日常变更、资产管理、紧急事件应急处理等工作;
- 分布式训练环境优化:优化分布式训练环境(如Kubernetes、Slurm集群),提升资源利用率与任务调度效率;
- 服务器性能优化:优化服务器性能,确保高效处理大规模数据集和复杂模型训练任务;
- AI团队协同支持:与AI团队合作,提供硬件和基础设施支持,满足AI模型训练和推理需求;
- 架构设计与技术评估:主导或参与系统架构设计、部署、运维等相关工作,研究和评估新技术应用,并推动适合的技术落地;
- 基础设施标准化与自动化:负责基础设施的标准化、工具化、自动化,服从上级主管安排的其他工作。
- 教育背景与专业知识:全日制本科及以上学历,计算机相关专业,五年以上相关工作经验,优秀者可适当放宽;
- 行业与专业经验:有半导体从业经验者优先;
- 专业技能与资格:精通NVIDIA GPU服务器架构,熟悉CUDA、cuDNN环境配置及性能调试;熟练使用Kubernetes管理容器化AI工作负载,了解RDMA、InfiniBand高速网络技术;熟练掌握主流服务器的硬件架构、安装、调试、性能优化及故障处理;熟练掌握脚本语言,至少精通Shell、Python其中一种,至少熟悉Ansible、SaltStack其中一种,能使用脚本自动化运维工作;精通Linux、Windows等主流操作系统,精通VMware等主流虚拟化技术;具有Linux、Windows、存储、备份、项目管理等相关认证者优先;具备ITIL理念,有相关ITIL证书者优先;
- 其他要求:工作态度踏实、认真、积极主动,具备良好的沟通、学习能力,具备强烈的责任心及团队协作精神。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring