多模态大模型算法工程师/研究员
step · 海淀区, 北京市, 中国
About The Role
我们正在寻找对多模态大模型算法或系统充满热情的人选加入我们的 AI 研发团队。你将参与下一代多模态大模型的设计、训练与优化,把最前沿的视觉智能能力打磨成真正可用、好用的产品体验。 1、参与多模态大模型(文本、图像、视频等)的算法研究与工程实现,重点攻关模型在复杂视觉场景下的代码生成能力——让模型不仅"看懂"页面,还能"写出"页面,覆盖从设计稿到可运行前端代码的端到端链路。 2、推动多模态模型的通用工具使用能力建设,让模型能够基于视觉输入调用 Python 工具、搜索工具、文件操作等通用工具链,实现从视觉理解到工具编排的闭环,支撑真实场景下的复杂任务自动化。 3、跟踪学术界与工业界前沿进展,方向包括但不限于鲁棒视觉表征与视觉特征编解码、多模态模型的 RLVR 与 RLHF、Synthetic Data、视觉审美与视觉品质评估等,持续打磨模型对视觉世界的"体感"——对构图、布局、风格、细节的直觉判断力。 4、设计与开发高效的分布式训练与数据系统,优化大规模多模态模型的训练流程与数据处理链路,支撑海量多模态数据的高效存储、检索、清洗与迭代,保障上述方向的快速落地。 【任职要求】 1、国内外计算机科学、人工智能专业的优秀本科生、研究生和博士生。 2、 极强的自驱力 :能够在方向不完全明确时自己定义问题、推动落地,不依赖被动派活。 3、 扎实的工程基建能力 :熟悉大模型背景下的分布式编程技术,能独立搭建、维护并优化训练与评测链路;精通 Python,熟悉至少一种主流的开源 LLM/VLM RL 训练框架(如 verl、AReaL、steptron 等),有在其上做二次开发或定制化训练流程的实战经验。 4、 对视觉与产品有独特的品味 :对"什么是好的视觉效果"、"什么是好的页面"、"什么是好的交互"有自己的判断和坚持,能把这种品味注入到数据、训练目标和评估标准中。 5、具备良好的沟通能力和团队协作精神,能独立解决复杂技术问题。 【加分项】 1、有大规模分布式训练系统或分布式数据系统开发经验,熟悉 DeepSpeed/Megatron 等并行训练框架,或有海量数据处理、存储、检索系统的实战经验。 2、有前端/Web 开发背景,或对 UI/UX、视觉设计有较深的理解与实践。 3、有 tool use、function calling、agent 系统等相关研究或工程经验。 4、在顶级会议/期刊(NeurIPS、ICML、CVPR、ACL、ICLR 等)发表过相关论文。 5、参与过开源大模型项目的贡献。 6、有算法竞赛教练或培训经历,ACM-ICPC、NOI/IOI 等编程竞赛获奖经历。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring