← Back to job listings
SU
HPC高级测试工程师(郑州)(J13897)
Sugon · 河南省·郑州市
About The Role
- 1.负责HPC(高性能计算)集群的全栈质量保障,覆盖计算节点、高速网络(InfiniBand/RoCE)、并行文件系统、作业调度系统(Slurm/PBS)、编译器与数学库等核心组件,设计并落地功能、性能、稳定性、兼容性等多维度测试方案。
- 2.集群功能测试: 验证HPC集群核心软件栈的正确性,包括但不限于:作业调度系统(作业提交、队列管理、资源分配、优先级策略)、并行文件系统(挂载、读写权限、元数据性能)、容器化HPC工作负载(Singularity/Enroot)的生命周期管理。
- 3.性能基准测试: 主导HPC集群的性能基准测试与调优工作,熟练运用HPL(High-Performance Linpack) 进行集群浮点计算性能评估、HPCG 作为HPL的补充评估实际应用场景性能、Stream 进行内存带宽测试、MPI OSU 进行网络通信性能评估;建立多维度性能测试数据库及基线,输出性能测试报告与调优建议。
- 4.异构计算测试: 验证GPU加速计算场景下的性能与正确性,覆盖CUDA/HIP编程模型、NCCL/RCCL多卡通信、NVLink/InfiniBand跨节点通信等;针对AI大模型训练场景(如Megatron-LM、DeepSpeed)进行分布式训练的性能与稳定性测试。
- 5.自动化测试框架建设: 开发与维护HPC自动化测试框架及脚本,实现集群部署验证、基准测试自动化执行、性能数据采集与可视化分析;利用AI技术辅助性能瓶颈分析与异常检测。
- 7.利用AI技术(如大模型辅助用例生成、智能缺陷分析、自动化脚本生成)提升测试效率与覆盖度,探索AI在业务测试领域的落地实践。
- 1.本科及以上学历,计算机、人工智能、软件工程、计算数学、力学等相关专业。[3年以上]测试开发或相关工作经验。
- 2.深入理解HPC集群的体系架构与核心组件,包括:
- 集群架构:计算节点、登录节点、管理节点、存储节点的功能划分与协同;
- 作业调度系统:Slurm/PBS的作业生命周期管理、资源分配策略、分区/队列配置;
- 高速网络:InfiniBand/RoCE的体系结构、通信原理与性能调优;
- 并行文件系统:Lustre/BeeGFS/GPFS的架构、条带策略、元数据管理;
- 软件栈:编译器(GCC/ICC)、MPI实现(OpenMPI/Intel MPI)、数学库(MKL/ACML)、GPU驱动与CUDA/HIP环境。
- 3.精通HPC性能基准测试方法论,有HPL、HPCG、Stream、MPI OSU等常规HPC基准测试与调优的丰富实战经验;能够根据集群配置选择最优参数、分析性能瓶颈并给出调优建议。
- 4.熟练掌握Python/Shell其中一种语言,具备独立开发自动化测试脚本及工具的能力;熟悉C/C++、Fortran加分。
- 5.具备扎实的并行计算技术理解力:理解MPI并行编程模型、OpenMP共享内存并行、GPU编程(CUDA/HIP/OpenACC)的基本原理;了解分布式训练中的通信模式(All-Reduce、All-Gather等)。
- 6.熟悉Kubernetes核心资源对象及调度原理,理解GPU调度(NVIDIA Device Plugin)、存储卷挂载(PV/PVC)等;具备在容器化环境中进行HPC工作负载部署与故障排查的实操经验。
- 7.熟悉Linux操作系统,熟练使用常用命令行工具及性能分析工具(如perf、nvidia-smi、ibstatus、mpstat等),能够独立完成系统日志分析、性能监控与问题定位。
- 8.精通软件测试流程与测试设计方法,能独立完成测试计划、用例设计及复杂场景测试执行。
- 9.具备优秀的逻辑思维与问题分析能力,良好的沟通协作能力与质量意识,对HPC与AI融合技术有持续学习的热情。
- 10.具备AI辅助测试的实践能力:了解大语言模型(LLM)基本原理,有利用AI工具(如大模型生成测试用例、辅助缺陷分析、自动生成回归脚本等)的实际经验,或对AI测试有浓厚兴趣并愿意快速学习。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring