Skip to content
← Back to job listings

算法工程师 (大模型分布式后训练方向)

UCloud · 上海市, 广东省·深圳市

External listingFull-time7 months ago

About The Role

我们正在寻找一位对技术充满好奇心、渴望做出成果并解决实际痛点问题的算法工程师加入我们的团队。在这个岗位上,你将不再局限于假设的场景和宽泛的技术,而是深入从数据的分析与准备,算法的选择与设计,到先进框架的使用与优化的完整链路中。你将负责跟进并掌握前沿的大模型分布式训练框架,产出高质量模型用于解决客户场景的实际需求。如果你渴望坐拥高性能集群并深入实践SFT和RL后训练,this is the right place.

核心职责 (Key Responsibilities)

  • 高效后训练方法使用与研究
  • 探究 FP8、MoE、LoRA 及多种并行策略在后训练阶段的协同方式,设计轻量级实验验证收敛性与稳定性
  • 持续跟进 GRPO 等最新 RLVR 算法,深度理解其奖励建模与策略更新机理,并积累算法改进和调优经验
  • 分布式训练框架优化与算法实现
  • 精读高效分布式训练框架(Megatron/Verl)核心模块,梳理模型实现、并行调度、计算通信优化等实现脉络,形成内部技术笔记与复用范例
  • 引入新的优化技术或提出新的优化点,将验证后的优化推广使用或回馈社区
  • 定制化训练项目的设计与实现
  • 根据客户的场景理解客户需求,提出数据要求并完成分析、清晰、构建等数据准备工作
  • 寻找最合适的训练方案和工程优化技巧,负责基座模型的选型、训练与评估
  • 教育背景:

计算机科学、人工智能、计算机视觉、机器学习或相关领域的硕士或博士学位。

  • 技术栈要求:
  • 理论基础:理解并掌握深度学习原理,熟悉Transformer-based LLM或VLM的计算和训练过程,熟悉至少 2 种后训练方法的原理(例如:SFT、LORA、PPO、GRPO等)。
  • 框架经验: 熟练掌握并实际使用过至少 2 种主流的模型推理或分布式训练框架(例如:vLLM, Sglang, Accelerate, Megatron-LM, DeepSpeed 等)。
  • 编程与实现: 精通 Python/C++,具备扎实的 PyTorch 功底,必须具备基于 原生Pytorch 实现深度学习训练过程或模型搭建的能力。
  • 软性素质:
  • 拥有极强的好奇心与探索欲,不满足于“知其然”,更追求“知其所以然”。
  • 习惯挑战未知领域,具备在文档缺失或技术前沿地带独立解决问题的能力,不坐以待毙。
  • 具备良好的沟通能力,能够清晰地向客户解释复杂的技术问题。
  • 加分项 (Preferred Qualifications):
  • 有实际落地交付模型的训练项目经验者优先。
  • 有多机多卡大规模分布式集群训推或性能调优工作经验者优先。
  • 有高性能计算(HPC)、CUDA 算子编写或优化经验者优先。
  • 在NeurIPS、ICLR等计算机会议上有发表,或在GitHub上有高质量开源贡献者优先。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing