Skip to content
← Back to job listings

大模型评测工程师

step · 海淀区, 北京市, 中国

External listingfull-time4 months ago

About The Role

岗位描述 1、跟进学术界和企业界前沿的评测基准,并持续健全世界级SOTA模型的观测榜单(例如OpenAI,Anthropic等发布的SOTA模型主要在哪些榜单上证明模型能力) 例如AIME、 GPQA、HLE、Codeforces、SWE、MultiChallenge、BrowseComp、Tau-Bench、 Aider、MMMU、MathVista等。 2、开发评测基建,联合模型训练框架共同开发评测体系,保证评测体系与开源社区和头部闭源模型可对比,具备完善的对点机制,保障评测结果的可靠性。 3、日常维护评测榜单,健全评测工程体系,提高评测的效率。 4、发现模型迭代中在榜单中所反映的能力欠缺问题,分析主流SOTA模型间在评测中体现的差异点。 岗位要求 1、熟悉大模型相关研究前沿进展,了解对市面主流benchmarks,具备大模型评测经验; 2、对数据有一定的敏感度,熟知开源社区各数据渠道源,有数据处理的经验和认知; 3、具有大模型各流程或全流程的研发/客观指标评测/Agent指标评测经验、模型训练/推理框架工程经验优先; 4、具备扎实的编程基础,有优秀的工程能力;具有NOI、ACM/ICPC等编程竞赛金牌获奖者优先; 5、有一定的相关研究经历,发表过顶级会议论文者优先;

This is an external listing. JobSpring does not represent or verify the employer. Report this listing