基础设施工程师-AI Infra方向
iluvatar · 闵行区, 上海市, 中国
About The Role
岗位职责: 1. 设计并实现自研GPU集群的云原生平台能力,包括Kubernetes GPU Device Plugin、Operator、容器runtime等组件。 2. 构建超节点集群调度系统,实现跨节点GPU作业调度、资源分配、负载均衡及拓扑感知调度,提升吞吐率和降低延迟。 3. 在GPU调度层面与大模型推理框架协作,规划和调度KV Cache和PD分离策略、实现高效GPU利用率、降低延迟并提升吞吐率。 4. 分析GPU集群硬件拓扑、网络和存储结构,为调度策略提供硬件感知能力。 5. 大模型推理集群部署与问题定位。 6. 设计并开发GPU集群监控与控制平面系统。 岗位要求: 1. 熟悉Linux,擅长Go/C++/Python编程语言。 2. 熟悉Kubernetes和容器技术,具备GPU云原生技术实践经验。 3. 熟悉作业调度框架(如 Volcano、Slurm),能设计和优化 GPU 作业调度、监控和资源分配策略。 4. 熟悉大模型推理流程,有vllm使用经验。 5. 熟悉基于Prometheus、ELK Stack、OpenTelemetry的可观测性体系建设,具备控制面板与运维平台开发能力。 加分项: 1. 熟悉GPU硬件拓扑(GPU/PCIe/NVLink/NUMA)、节点间网络(RDMA/InfiniBand/NVSwitch)及存储I/O优化,具备硬件感知调度能力。 2. 了解大集群推理框架(LLM-D、AiBrix)及跨节点调度特性,能在调度层优化KV Cache和PD分离,实现高GPU利用率和低延迟。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring