Skip to content
← Back to job listings

27届Stepstar-大语言模型pre-train 数据算法工程师

step · 海淀区, 北京市, 中国; 徐汇区, 上海市, 中国

External listingfull-timeabout 1 month ago

About The Role

【岗位描述】 1. 负责大语言模型预训练数据体系建设,包括数据采集、清洗、去重、质量过滤、配比设计与数据版本管理; 2. 参与构建面向代码、数学、Reasoning、长文本、多语言、多模态等能力方向的数据recipe,支持下一代基座模型能力提升; 3. 结合模型训练效果和评测结果,分析数据质量、数据分布与模型能力之间的关系,持续优化数据策略; 4. 负责数据消融实验与数据飞轮建设,通过回流数据、合成数据、自蒸馏数据等方式持续提升模型表现; 5. 与训练、评测和基础设施团队协作,推动大规模数据处理和训练流程稳定落地。 【岗位要求】 1. 预计毕业时间介于2026年9月至2027年8月的国内外计算机、数学、人工智能、数据科学等相关专业的优秀应届毕业生; 2. 具备扎实的编程基础,熟悉Python,了解数据处理、分布式计算或大规模数据pipeline者优先; 3. 对大模型数据工程、预训练数据配比、数据质量评估、合成数据等方向有浓厚兴趣; 4. 具有大模型、NLP、信息检索、数据挖掘、代码数据或多模态数据相关实习/科研经验者优先; 5. 具备良好的实验分析能力、工程落地能力、团队协作能力和沟通能力。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing