Skip to content
← Back to job listings

RL Infra 研究工程师

moonshot · 海淀区, 北京市, 中国

External listingfull-time7 months ago

About The Role

职位描述: 主要负责维护和开发Moonshot内部的强化学习后训练框架,支持万亿参数模型reasoning、agentic等方向的文本&多模态RL后训练; 与训练推理引擎方向的团队合作,探索算法、框架、硬件的协同设计,提升大规模强化学习训练的稳定性和效率; 职位要求: 有扎实的工程算法基础和工程实现能力,熟悉Python等语言,熟练掌握Pytorch等深度学习框架和常见性能调试/分析工具; 对Megatron-LM/vLLM等主流训推引擎有深入的了解,对大模型RL训练中的实际问题(如训推不一致、Rollout长尾等)排查和解决有经验; 有扎实的强化学习算法基础和实际RL训练经验; 加分项:有出色的开源项目经历(如为vLLM、VeRL等框架提交过重要PR)、对口的顶会发表者(如RL稳定性、环境scaling、长尾问题解决等Paper)优先; 业界知名RL框架经验(如verl、roll、slime等) / 开源项目贡献者 / 顶会paper

This is an external listing. JobSpring does not represent or verify the employer. Report this listing