预训练数据工程师
high-flyer · 拱墅区, 浙江, 中国; 海淀区, 北京市, 中国
About The Role
【团队使命】 预训练数据开采自人类世界全部已有知识所沉积的富矿,是驱动模型强大能力的核心燃料。 预训练数据团队围绕大模型预训练,构建了从数据采集、清洗处理到底层基础设施的完整数据体系,持续为模型训练输送高质量、规模化、多模态的数据燃料,不断拓展模型的世界知识边界。 如何寻找蒙尘的富矿,并淘洗炼制成可用的智能燃料,是一门极难的硬功夫。我们以亿万数据筑就模型智能的坚实底座,更要用普惠的方式,把这份属于全人类的财富,重新还给全人类。 招聘方向 【实习/全职】 : 数据采集 pipeline 方向、语言数据处理方向、多模态数据方向、数据基建方向。 数据采集 pipeline 方向 【岗位职责】 1.全网数据选取策略设计开发 (1)根据数据清洗反馈信号设计全网数据选取、调度系统,包括链接质量预估、属性聚合、站点抓取配额、数据优先级等,保证数据多样性,最大化数据覆盖,为模型训练提供丰富的世界知识。 (2)面向 RAG 等时效场景,负责时效性种子挖掘、调度与有效性验证,保障关键信息的新鲜度。 2.全网数据采集环路 (1)负责全网数据采集环路的设计与开发,包括但不限于下载、任务调度、流式数据处理、DNS、连通性等核心组件,构建高吞吐、可容错的分布式采集系统。 3.链接规模控制 (1)通过识别低质站群、重复镜像站点、清洗 URL 冗余参数、规范化链接等手段,控制链接规模、去除重复与噪声,提升链接库的有效性与数据纯净度。 【岗位要求】 1.计算机或数学相关专业,本科及以上学历。 2.熟练使用至少一种编程语言,包括但不限于 Python/C++/Rust。 【加分项】 1.数学或信息学竞赛中取得优秀成绩。 2.有大规模数据采集、爬虫或数据 pipeline 系统研发经验。 语言数据处理方向 【岗位职责】 1.参与大模型预训练语料清洗框架研发,建设稳定、高效、可扩展的大规模数据处理平台,建设面向海量数据的离线处理能力,支持复杂数据链路的调度、运行、恢复和监控。 2.研发核心语料清洗能力,负责 MinHash 去重、向量去重等关键环节,与算法、训练、搜索和基座团队协作,快速落地新的数据策略。 3.维护日常生产流水线,支持每日增量处理、任务调度、数据统计、质量回归、线上问题排查和稳定性保障。 4.优化大规模数据清洗系统的性能、稳定性和可观测性,完善日志、指标、监控、测试与调试工具。 【岗位要求】 1.计算机、人工智能相关专业,本科及以上学历。 2.熟练使用 Python 及任意一种常用数据处理工具链(pandas / spark / duckdb 等)。 【加分项】 1.对世界有好奇心,对模型行为有自己独特的理解。 2.对模型能力边界有敏锐判断,善于发现模型在真实场景中的短板和失效模式。 3.优秀的跨团队沟通能力,能与标注、产品、工程等多角色高效协作。 4.有大规模数据清洗 pipeline 落地经验(TB级别 tokens)。 多模态数据方向 【岗位职责】 1.负责大规模多模态数据(图像、视频、图文结合等)的数据结构设计、存储架构规划与全生命周期管理,涵盖数据安全管控、自动化校验与质量治理,保障数据的高可用与合规性。 2.负责多模态数据清洗与标注链路的工程优化,结合内容理解技术,提升数据去重、结构化、质量筛选、打标分析等流程的效率与质量。 3.针对Pretrain/SFT/RL等不同阶段,设计并优化数据存储方案与数据结构使数据组织方式更适配下游模型训练需求,与框架同学、算法同学协同提升训练数据供给效率。 4.建设数据分析与可视化体系,挖掘数据特征与模型训练效果的关联,搭建易用的数据可视化工具,帮助团队通过更全面易用的数据分析提升模型表现。 【岗位要求】 1.计算机基础扎实,熟悉 Python,了解 PyTorch。 2.具备系统性能分析与调优能力,能深入 CPU、网络、存储等技术细节,定位并解决大规模数据链路的性能瓶颈。 3.熟悉常见数据处理与存储格式,了解常见数据结构。 4.对多模态大模型有一定的认识和了解,清楚其结构和原理,以及所需训练数据的一般形态与需求。 5.对大规模多模态数据生产与管理有强烈兴趣,愿意深入数据工程全链路,追求高质量、高效率的数据供给。 【加分项】 1.有大规模分布式数据处理系统的研发与性能优化经验。 2.具备高并发、异步编程经验,有完整的大规模数据链路开发与调优经历。 3.了解多模态模型的常见训练与部署框架(如 Megatron、vLLM 等)。 4.在算法竞赛(NOI/IOI/ICPC/CCPC 等)中取得优异成绩。 数据基建方向 【岗位职责】 1.负责键值数据库、消息队列等核心数据组件的开发、维护与调优,保障从数据采集到模型消费全链路的高性能与高可靠。 2.面向多模态海量数据,负责数据管理与数据湖方案的设计与落地,对接对象存储、分布式文件系统等底层基建。 3.设计与开发分布式数据处理框架,支撑 PB 级数据的高效处理。 4.负责在线与批处理任务的 CPU、内存、网络调优,持续提升吞吐与资源利用率。 5.与数据采集处理、模型训练等团队紧密协作,设计并提供易用的 API、库与工具,支撑数据的探索、加工与规模化使用。 【岗位要求】 1.计算机相关专业。 2.扎实 Rust/C++/Python 编程能力。 3.扎实的工程能力与系统功底,深刻理解计算机组成、操作系统与计算机网络。 4.深入理解分析型数据处理引擎的计算和数据存储格式。 5.能灵活运用文献和开源项目中数据库系统的常见范式和经验。 【加分项】 1.有大规模存储、分布式 KV、数据库或数据湖、分布式数据处理框架的设计/研发/运维等经验。 2.在高水平系统会议论文上发表过论文。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring