27届Stepstar-Code Agent 算法研究员
step · 海淀区, 北京市, 中国; 徐汇区, 上海市, 中国
About The Role
【岗位描述】 1. 负责代码数据的合成、清洗、权重分配、来源扩充等一系列工作,持续提高代码中程训练、后训练等阶段的数据质量;负责探究预训练小领域数据的配比和最终效果之间的关系;开发数据合成链路,解决代码模型中的关键问题; 2. 负责探究深度推理技术,探究Test-time Compute和模型效果的Scaling laws,参与后训练奖励模型、强化学习算法的一系列优化流程,探究线上代码补全数据到RL过程的数据飞轮。 3. 专注于代码强化学习中的奖励模型(Reward Model)的优化和创新;包括和SFT阶段配合解决判别能力较差的场景、探究合成数据进行代码奖励模型的预训练、组织标注人员进行代码奖励模型的标注、Critic的前沿探究、强化学习过程中的可执行代码与单元测试的质量过滤和扩充。 4. 利用强化学习方法改进智能体的规划、反思、利用工具的能力,强化在code agent实际场景的可用性; 5. 探索基于人机协同的高质量数据挖掘、合成,以加强智能体的规划和利用工具能力; 6. 构建code agent的基础能力,包括planning能力、测例、代码生成能力; 7. 构建多模态智能体,提升多模态大模型RLHF中的训练效果; 8. 构建code agent智能体自动化评测和docker环境生成。 【岗位要求】 1. 预计毕业时间介于2026年9月至2027年8月的国内外计算机、数学、人工智能等相关专业的优秀应届毕业生; 2. 具备软工背景,具有扎实的计算机科学功底和编程能力,熟悉常见算法和数据结构,具有良好的编程习惯; 3. 熟悉语言模型的基本技术、模型结构,对AI的未来有信仰和工作热情; 4. 工作认真细致,计划性强,具有刨根问底的探究精神,对研发工作中有很强的实事求是的落地信念,追求最终效果而不是盲目追求新颖的方法,对工作内容有较强责任感。 加分项: 1. 有NOI、ACM竞赛经历者优先;有推荐、搜索领域出色的数据驱动工作者优先; 2. 熟悉强化学习相关技术和细节,曾深度参与强化学习项目或语言模型项目; 3. 具有较强的工程能力,能迅速熟悉公司内外部平台工具使用,具有主动提升效率的意识。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring