大模型算法工程师(数据方向)
moonshot · 海淀区, 北京市, 中国
About The Role
岗位职责 负责大语言模型 pretrain 数据算法的设计与实现,包括数据选择、质量建模、去重、过滤、数据配比、合成数据与课程学习等方向。 将数据算法落地到大规模数据处理流程中,基于 Ray、Spark 等分布式框架处理海量训练数据。 设计并执行数据消融实验,评估不同数据源、质量过滤策略、去重策略、配比方案和采样策略对模型能力的影响。 建设数据到模型效果的实验闭环,结合训练 loss、benchmark、能力维度评测、训练动态和样本分析,定位数据问题并迭代数据策略。 岗位要求 计算机、人工智能、数学、统计学等相关专业,本科及以上学历。 熟悉大语言模型预训练范式,理解 pretrain 数据对模型能力、训练稳定性和 scaling behavior 的影响。 具备扎实的机器学习、NLP 或大模型算法基础,能够独立完成算法设计、实验设计、结果分析和策略迭代。 熟练使用 Python,熟悉 PyTorch、TensorFlow、JAX 等至少一种深度学习框架。 熟悉大规模数据处理,有 Ray、Spark 等分布式计算框架使用经验。 具备良好的工程实现能力,能够将数据算法实现为稳定、高效、可复用的大规模处理 pipeline。 具备较强的数据分析能力,能从 loss 曲线、评测结果、数据分布和样本案例中定位问题。 具备良好的论文阅读、问题拆解和跨团队协作能力。 加分项 有 LLM pretrain / midtrain 数据实验经验,或参与过基础模型训练项目。 有数据消融、数据配比、数据选择、质量建模、合成数据、课程学习相关经验。 熟悉 MinHash、SimHash、LSH、embedding-based filtering、classifier-based filtering、perplexity filtering 等方法。 有 benchmark contamination / leakage 检测、评测集去污染经验。 有代码、数学、多语、多模态等专项数据算法经验。 有 PB 级文本数据处理经验,或熟悉云上/K8s/集群计算环境。 在 NLP、机器学习、数据挖掘、大模型训练等方向有论文、竞赛、开源或工业落地成果。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring