Skip to content
← Back to job listings

大模型评测基建工程师

step · 海淀区, 北京市, 中国; 徐汇区, 上海市, 中国

External listingfull-time4 months ago

About The Role

岗位职责: 构建真实工作场景/Code Task Benchmark (Docker-based tasks(s) 设计Agent执行环境,包括代码运行、测试与结果验证框架 研发CodeAgent框架,实现任务规划、代码生成、执行与迭代闭环 构建Agent Runtime,包括工具调用、环境管理与执行状态控制 搭建可扩展的模型对比评测系统(multi-modelevaluation) 优化Agent执行稳定性、可复现性与评测效率 推动研究能力向工程系统转化,支持模型与Agent的快速迭代 岗位要求: 扎实的软件工程能力,熟练掌握Python,Go, TypeScript等开发语言 熟悉Docker/Linux环境与自动化执行流程 理解LLMAgent工作机制与工具调用模式 有复杂系统设计与工程落地经验 熟悉测试体系、任务执行与自动化 workflow设计 优先考虑: 有LLMevaluation/benchmark构建经验 熟悉SWE-bench或类似代码任务评测框架 开发过CodeAgent或自动化编程系统 熟悉Agent orchestration / multi-agent framework 有模型比较或大规模实验平台经验

This is an external listing. JobSpring does not represent or verify the employer. Report this listing