← Back to job listings
UC
算法工程师 (大模型分布式后训练方向)
UCloud · 上海市, 广东省·深圳市
About The Role
我们正在寻找一位对技术充满好奇心、渴望做出成果并解决实际痛点问题的算法工程师加入我们的团队。在这个岗位上,你将不再局限于假设的场景和宽泛的技术,而是深入从数据的分析与准备,算法的选择与设计,到先进框架的使用与优化的完整链路中。你将负责跟进并掌握前沿的大模型分布式训练框架,产出高质量模型用于解决客户场景的实际需求。如果你渴望坐拥高性能集群并深入实践SFT和RL后训练,this is the right place.
核心职责 (Key Responsibilities)
- 高效后训练方法使用与研究
- 探究 FP8、MoE、LoRA 及多种并行策略在后训练阶段的协同方式,设计轻量级实验验证收敛性与稳定性
- 持续跟进 GRPO 等最新 RLVR 算法,深度理解其奖励建模与策略更新机理,并积累算法改进和调优经验
- 分布式训练框架优化与算法实现
- 精读高效分布式训练框架(Megatron/Verl)核心模块,梳理模型实现、并行调度、计算通信优化等实现脉络,形成内部技术笔记与复用范例
- 引入新的优化技术或提出新的优化点,将验证后的优化推广使用或回馈社区
- 定制化训练项目的设计与实现
- 根据客户的场景理解客户需求,提出数据要求并完成分析、清晰、构建等数据准备工作
- 寻找最合适的训练方案和工程优化技巧,负责基座模型的选型、训练与评估
- 教育背景:
计算机科学、人工智能、计算机视觉、机器学习或相关领域的硕士或博士学位。
- 技术栈要求:
- 理论基础:理解并掌握深度学习原理,熟悉Transformer-based LLM或VLM的计算和训练过程,熟悉至少 2 种后训练方法的原理(例如:SFT、LORA、PPO、GRPO等)。
- 框架经验: 熟练掌握并实际使用过至少 2 种主流的模型推理或分布式训练框架(例如:vLLM, Sglang, Accelerate, Megatron-LM, DeepSpeed 等)。
- 编程与实现: 精通 Python/C++,具备扎实的 PyTorch 功底,必须具备基于 原生Pytorch 实现深度学习训练过程或模型搭建的能力。
- 软性素质:
- 拥有极强的好奇心与探索欲,不满足于“知其然”,更追求“知其所以然”。
- 习惯挑战未知领域,具备在文档缺失或技术前沿地带独立解决问题的能力,不坐以待毙。
- 具备良好的沟通能力,能够清晰地向客户解释复杂的技术问题。
- 加分项 (Preferred Qualifications):
- 有实际落地交付模型的训练项目经验者优先。
- 有多机多卡大规模分布式集群训推或性能调优工作经验者优先。
- 有高性能计算(HPC)、CUDA 算子编写或优化经验者优先。
- 在NeurIPS、ICLR等计算机会议上有发表,或在GitHub上有高质量开源贡献者优先。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring