Skip to content
← Back to job listings

RL infra

moonshot · 海淀区, 北京市, 中国

External listingfull-time3 months ago

About The Role

职位概览 在 Moonshot,我们相信强化学习是通往 AGI 的关键路径。我们正在寻找深谙 GPU 性能极限的 RL Infra 工程师,打造支撑下一代大模型自我进化的基础设施。 你将直面 RL 训练的核心矛盾:训练与采样的异构负载、频繁权重复制带来的通信开销、多轮超长Agentic Coding和KimiClaw 场景的rollout效率。通过极致的工程优化,让 RL 训练跑得更快、更稳——每一次参数更新,都让 Kimi 的推理能力更进一步。 核心职责 RL 训练架构 :针对大规模 Agentic RL 场景,设计训练与采样的混合调度策略,优化多模型(Policy、Reference、Reward、Value)的并行协同与显存共享 Rollout 效率优化 :深度定制 vLLM,优化 Rollout 阶段的 KV Cache 复用、量化和投机方法,将 Token 生成延迟压至极限 算法/框架/硬件协同优化 :深入理解硬件,为 RL 的不同算法负载、不同硬件设施定制最优并行策略,最大化 MFU。 技术要求 希望你至少熟悉其中一个方面: 通用训练/推理 精通 Megatron-LM 分布式并行(TP/PP/CP/EP),能针对 RL 的多模型场景定制调度策略 熟悉 vLLM / SGLang 核心机制(PageAttention、Prefix Caching、FlashAttention、MTP),具备二次开发能力 扎实的 CUDA / Triton / Cutlass 编程能力,有过算子开发经验,能编写贴合 SM 调度与内存层次的高性能 Kernel 熟练使用 Nsight 工具链进行全链路性能分析,用数据驱动优化 强化学习 深入理解 RLHF / RL 推理的数据流:Policy 采样 → Reward 评估 → 优势估计 → 策略更新,能针对每个环节的负载特征做针对性优化 熟悉 PPO、GRPO、DPO 等算法的工程实现细节,理解其稳定性挑战与优化技巧 有大规模 RL 训练(千卡以上)实战经验,处理过训练崩溃、奖励 Hack、方差爆炸等典型问题 为什么是你 希望你具备第一性原理的思维方式和精益求精的极致追求。不满足于"跑通 RL",而是持续压榨硬件效率的上限,并与算法团队深度协同,探索下一代 RL 训练框架的演进方向。 加入 Moonshot,让每一次 RL 训练都成为 Kimi 智能跃迁的阶梯。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing