Skip to content
← Back to job listings

高级推理平台工程师(大模型推理云平台基础设施)

step · 海淀区, 北京市, 中国; 徐汇区, 上海市, 中国

External listingfull-time4 months ago

About The Role

岗位介绍 我们正在建设面向大模型场景的新一代推理云平台,持续打造覆盖服务控制面(Control Plane)、资源调度、云上基础设施、网络架构与存储接入的核心平台能力。你将参与平台核心系统的架构设计与研发,支撑模型服务在大规模 IDC 与云上环境中的部署、调度、治理与稳定运行,推动平台能力持续演进。 岗位职责 - 负责推理云平台核心系统的架构设计与关键模块开发,建设服务控制面、配置管理、发布变更、运行治理等平台能力 - 面向大规模 IDC 与云上环境,设计和演进平台基础设施架构,提升系统在复杂部署场景下的稳定性、扩展性与可运维性 - 基于 Kubernetes 持续建设和优化平台能力,支持服务编排、资源管理、弹性扩缩容、集群治理与多环境交付 - 推动云上网络、服务接入与存储系统的对接和整合,支撑模型服务的高可用访问与高效运行 - 建设平台监控、日志、性能分析等可观测性体系,提升平台运行效率与问题定位能力 - 主导复杂技术问题攻关,与模型、推理引擎、基础设施等上下游团队协作,推动平台能力标准化、工程化与规模化落地 任职要求 - 计算机相关专业本科及以上,具备扎实的数据结构、算法、操作系统、网络与分布式系统基础 - 熟悉 Python、Go、Java、C++ 中至少一种,具备良好的工程能力与系统设计能力 - 具备较强的后端平台、分布式系统或云原生基础设施研发经验,能够独立负责复杂模块设计与落地 - 深入理解 Kubernetes 及云原生技术体系,具备生产环境下的平台建设经验 - 对大规模 IDC、云上基础设施、云上网络架构、存储系统对接有较深理解和实践经验 - 熟悉主流公有云产品,了解计算、网络、存储、负载均衡、容器服务等核心能力 - 热爱 AI 技术,对大模型方向有持续关注,了解模型基础原理、推理服务基本机制及行业发展趋势 - 能够主动将 AI 能力应用到日常研发、运维或协作流程中,提升工程效率与问题分析能力 - 具备良好的沟通协作能力,能够跨团队推动平台能力建设与技术方案落地 加分项 - 有大模型推理平台、模型服务平台或 AI Infra 相关经验 - 有混合云、多集群、跨地域基础设施或大规模资源平台建设经验 - 熟悉云上网络、服务访问链路、流量治理或高可用架构设计 - 有存储接入、数据平台、模型分发或大规模文件/对象存储相关经验 - 有开源项目贡献经验,活跃开源贡献者优先

This is an external listing. JobSpring does not represent or verify the employer. Report this listing