← Back to job listings
ST
大模型强化学习系统工程师
step · 海淀区, 北京市, 中国; 徐汇区, 上海市, 中国
About The Role
岗位简介 负责大模型 RL 训练与推理系统建设,支持训练效率、系统稳定性和工程迭代速度的持续提升。工作内容覆盖分布式训练、推理链路、性能优化、稳定性治理,以及 Agent RL 相关能力建设。 岗位职责 1. 负责 RL 训练与推理基础设施的设计、开发与优化。 2. 负责分布式训练、任务调度、权重同步、热更新等核心链路建设。 3. 持续优化系统性能,包括吞吐、时延、GPU 利用率、训练效率等指标。 4. 建设稳定性与可观测能力,定位并解决 OOM、超时、通信瓶颈、一致性问题等。 5. 参与 Agent RL 相关训练与系统支持工作,推动训练框架适配更复杂的 Agent 场景。 任职要求 1. 熟悉 PyTorch、CUDA、NCCL、Linux,理解分布式训练与推理系统基本原理。 2. 了解 RLHF 或相关训练方法,对 PPO、DPO、GRPO、Agent RL 等方向有实际经验或较强理解。 3. 有性能分析、问题排查和系统优化经验,能独立定位复杂问题。 4. 熟悉 AI Coding,有使用或建设代码助手、自动化研发工具、Coding Agent 的经验。 5. 有代码品味,对工程质量有要求,乐于学习新技术、新工具和新方法。 加分项 1. 有大模型训练或推理系统相关经验。 2. 有多机多卡、集群训练或在线服务稳定性治理经验。 3. 对 Agent、推理优化、系统架构演进有持续兴趣。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring