机器学习平台工程师
step · 徐汇区, 上海市, 中国; 海淀区, 北京市, 中国
About The Role
工作职责: 与公司算法和框架团队深度合作,为大模型进行算法与算力深度结合的的联合优化,打造超大规模高效可靠的大规模算力平台,提升平台可用性和容错性,提升训练任务的运行和开发效率。 进行前瞻性技术调研且进行自主创新,保持公司在大模型系统方面的技术领先地位。 负责机器学习平台的开发,支撑公司相关业务的算法生产与高效迭代; 负责设计和实现机器学习相关的基础设施、工具链、训推产品等,并推动落地到业务中; 负责训推任务的监控、问题监测、性能调优,降本增效; 探索业界前沿的AI Ops相关技术,持续提升平台能力、降低算法使用成本; 任职资格: 统招研究生及以上学历 ,计算机科学 、人工智能或相关领域专业。两年及以上相关工作经验 了解前沿的AI技术,有工程实践经验者优先; 熟练掌握Linux环境下的C/C++,Go,Python语言。 了解或使用过常用MLOps和任务调度框架之一:Kubeflow,MLFlow,Volcano,或类似自研项目。 熟悉英伟达/AMD/国产GPU/NPU计算卡的环境配置和编程;熟悉RoCE/IB等高速网络环境配置和编程;熟悉CUDA、NCCL等计算和通行库的原理和使用;熟悉CUDA和NCCL相关问题的调研和排错者优先;具有二次开发能力者优先; 熟悉TensorFlow/PyTorch模型的训练和部署;掌握K8s扩展功能开发者优先; 了解Agent原理和技术进展,有工程实践经验者优先; 了解业界常用深度学习框架,如Tensorflow/PyTorch,了解常用的分布式加速库包括但不限于:Megatron,DeepSpeed等; 具有独立解决问题的能力,良好的团队合作精神。 有强烈的工作责任心,较好的学习能力、沟通能力和自驱力;有良好的工作文档习惯,及时按要求撰写更新工作流程及技术文档。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring