大模型训练框架工程师(预训练方向)
step · 徐汇区, 上海市, 中国; 海淀区, 北京市, 中国
About The Role
岗位职责 负责深度学习训练框架研发,包括框架的内核开发、算子适配、功能迭代及性能优化,定位并修复框架底层问题。 负责大模型分布式训练系统研发,设计并优化数据并行(DP)、张量并行(TP)、流水线并行(PP)、序列并行(SP)、专家并行(MoE)、ZeRO/FSDP 等并行策略,提升超大规模模型训练效率。 负责大模型训练性能优化,包括 CUDA Kernel 优化、通信优化、显存优化、低精度训练、激活重计算(Checkpoint)等,持续提升训练吞吐。 负责大模型训练稳定性建设,包括训练指标监控与分析、Loss/Grad 异常定位、性能瓶颈分析及故障排查等,保障大规模训练稳定运行。 协同算法团队推进大模型训练方案落地,对公司内、业界开源的新结构、算法进行实现和优化,支撑新模型和新算法快速迭代。 任职要求 熟练掌握 C++、Python,具备扎实的计算机体系结构、操作系统、Linux 及并发编程基础。 熟悉 CUDA 编程及 GPU 架构,具备 CUDA Kernel 开发与性能优化经验。 熟悉 PyTorch 深度学习框架,了解 Autograd、ATen、Dispatcher 等核心机制,具备框架开发或自定义算子开发经验。 熟悉分布式训练原理,掌握至少一种大模型训练框架或并行方案,如 Megatron-LM、DeepSpeed 等。 具备大规模模型训练、训练性能优化或训练稳定性问题定位经验,有 Loss 不收敛、通信瓶颈、显存优化等问题解决经验者优先。 加分项 有千亿参数大模型、千卡及以上规模全流程训练经验 有 PyTorch、DeepSpeed、Megatron-LM 等开源项目贡献经验; 有 OSDI、SOSP、NSDI、MLSys等 AI 系统相关顶会论文发表经验;
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring