Skip to content
← Back to job listings

大模型训练优化工程师

step · 海淀区, 北京市, 中国

External listingfull-time2 months ago

About The Role

工作职责 1 负责大语言模型(LLM)训练基础设施的设计与开发,包括大规模数据加载优化、训练数据构建和数据处理 Pipeline。 2 负责大规模训练数据格式与存储方案设计(如 WebDataset / Sharded Dataset 等),优化数据 IO 和分布式训练场景下的数据吞吐能力。 3 负责模型工具链建设,包括模型格式转换、权重切分与合并、跨框架模型迁移(如 HuggingFace / Megatron 等)。 4 参与大模型训练系统开发与优化,支持预训练、SFT、RLHF 等不同训练流程,提高训练效率和 GPU 利用率。 5 参与大模型推理基础设施开发,建设高性能推理平台,支持在线推理服务。 6 跟踪大模型训练与推理领域的前沿技术(如高效数据管道、训练加速等),持续推动系统能力升级。 任职资格 1 计算机科学、人工智能、软件工程或相关专业,硕士及以上学历。2年以上AI Infra相关的工作经验。 2 精通Python / Go / C++ 中至少两门语言,有一定的代码品味,能编写高质量的代码。 3 有良好的算法和数理基础,熟悉常用算法。 4 熟练掌握深度学习框架(PyTorch)、分布式训练技术(5D并行)及相关框架(Megatron-LM),有实际的模型训练经验。对LLM训练的各个环节尤其是dataloader、checkpoint等模块有深入研究。 5 熟练使用分布式计算系统如Ray、Spark,有实际使用和应用调优的经验。 6 擅长性能优化,对性能和稳定性有极致的追求,能在压力下快速的定位到性能瓶颈,并落地优化方案。 7 具备良好的问题分析与解决能力,良好的团队合作精神和沟通能力,能编写高质量文档。 加分项: 在国内外知名会议发表过相关领域的高质量论文; 在ACM、PAC等编程竞赛中取得过较好成绩。 知名开源项目的core contributor或maintainer。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing