Skip to content
← Back to job listings

软件工程师(GPU RAS研究)

iluvatar · 闵行区, 上海市, 中国

External listingfull-time14 days ago

About The Role

岗位职责: 聚焦GPU-RAS(可靠性、可用性、可服务性)技术研究,覆盖硬件层、软件层全栈研发,主导GPU RAS特性的规划、架构设计与技术突破,解决智算中心、异构计算场景下GPU故障检测、隔离、恢复及可维护性核心问题,推动RAS技术在GPU产品中的落地与优化,支撑大规模GPU集群的稳定运行。 任职要求: 学历及专业 1.本科及以上学历,计算机科学与技术、微电子、电子工程、物理、材料科学等相关专业; 2.具备半导体物理、计算机体系结构、芯片可靠性相关理论基础,了解GPU基本架构或CUDA/ROCm软件栈者优先; 核心专业技能 1.了解RAS核心技术体系,理解可靠性(R)、可用性(A)、可服务性(S)的基本定义及实现思路,熟悉RAS与DFX的关联关系,了解相关行业标准者优先; 2.有GPU相关研发、研究经验者优先,熟悉GPU基本硬件架构(如计算核心、PCIe接口等),了解CPU/GPU协同机制; 3.掌握至少一种编程语言(C/C++优先),熟悉Linux开发环境及Shell/Python脚本编写,能熟练使用git代码管理工具,具备Linux内核驱动开发、系统调试经验者优先; 4.了解芯片可靠性试验方法与标准,熟悉JEDEC等行业可靠性标准,掌握失效分析相关工具(如OM/SAT/X-ray、crash、gdb等),具备故障注入、失效机理分析能力者优先; 5.熟悉GPU RAS关键技术,包括但不限于错误检测与纠正(ECC)、故障隔离、热插拔、带外管理(BMC)、BIOS/OS协同错误处理等,有相关技术研究或实现经验者优先; 研究与创新能力 1.具备较强的独立研究能力,能够聚焦GPU RAS领域的核心痛点(如算力提升带来的故障率上升、故障导致的算力浪费等),开展前瞻性技术研究与方案设计; 2.具备良好的技术敏感度,跟踪GPU RAS领域前沿技术(如AMD CDNA系列、NVIDIA GPU的RAS特性)及行业动态,能够结合实际场景提出创新技术方案; 3.具备扎实的数据分析与建模能力,能够运用统计工具(如JMP)开展可靠性数据处理、故障预测建模,优化RAS特性性能; 4.具备学术研究或技术攻关经验,有相关领域论文、专利(第一作者/发明人优先),或主导过GPU RAS相关技术研发项目者优先; 加分项 1.有丰富的HPC/AI超算、云计算领域RAS相关工作经验,具备大规模GPU集群RAS设计或优化经验者; 2.熟悉GPU可靠性仿真工具(如gem5、GPGPU-Sim),具备RAS特性仿真、验证经验者; 3.有半导体行业芯片可靠性工作经验,精通磨损失效机制(TDDB、BTI等)及加速测试方法者; 4.在国际顶会、核心期刊发表过GPU RAS、芯片可靠性相关论文,或拥有相关核心专利者。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing