高性能算子/通信/编译器工程师
high-flyer · 拱墅区, 浙江, 中国; 海淀区, 北京市, 中国
About The Role
【团队使命】 我们构建 AGI 与物理芯片之间的最后一层软件,为训练推理框架和研究员提供高性能的计算算子、集合通信和领域编译器 ,同时也是模型设计和硬件 co-design 的桥梁。 团队的唯一标准:硬件的物理极限。我们不和任何 baseline 或者其他实现比较性能差异,只关心当前设计和实现距离理论上限还有多远,对每一个 cycle 和每一瓦功耗有着近乎偏执的追求。 我们为上层框架和研究员提供稳定的接口,使底层的高性能实现以使用友好、可靠且可维护的方式融入整个系统。 加入我们,你将同时深入 NVIDIA GPU 和 Ascend NPU 等国产硬件,从指令集、内存模型、编译栈到大规模互联,系统性地掌握多种硬件体系。我们不在意你是否有相关背景 —— 我们会尽可能提供必要的指导,但需要的是你对细节的严谨和对性能优化的热情。 【岗位类别】:实习/全职 【工作职责】 1.针对 GPU/NPU 等架构,使用 CUDA、Ascend C 和 TileLang,设计、实现并长期维护 GEMM、Attention 以及其他算子。 2.针对不同通信场景和网络架构,设计、实现并长期维护通信算子(如 DeepEP 中的 EP、CP/DP、Engram、PP),同时持续对 NCCL/HCCL 等主流集合通信库进行调优和排障。 3.参与面向深度学习的 DSL 编译器(如 TileLang 等)的研发,负责设计面向新一代硬件的编译优化,并围绕内部实际的新模型、新算子和性能优化的需求扩展 DSL/IR/CodeGen 的能力,并在保持接口的简洁和可维护性的同时尽可能提升性能。 4.紧贴模型结构和算法演进,和框架同学、研究员共同为新思路设计硬件友好的模型结构和算法,并对真实训练/推理负载持续进行性能分析。 【核心要求】 1.熟悉 C++ 等编程语言,熟练掌握 Git 等工具。 2.对细节有较高关注,对性能优化有较高热情,眼界广阔,同时对代码有品味的追求。 3.良好的中文沟通能力。 【加分项】 (不强制要求,也充分欢迎有热情的白纸同学加入) 1.有过 CUDA 或 Ascend C 算子编写经验,熟悉 CUTLASS、DeepGEMM 等算子库,熟练掌握 PTX ISA、Ascend C API 并深入理解 memory model 和硬件体系结构。 2.熟悉主流深度学习分布式通信库(如 NCCL、HCCL、NVSHMEM 和 DeepEP 等)的底层实现原理,具备丰富的性能调优与故障排查经验。 3.深入理解 RDMA 技术原理与 RoCE/InfiniBand 网络架构,具备丰富的 RDMA 开发经验,熟悉 IBGDA 等 RDMA 高阶特性。 4.具备编译器或 DSL 系统的开发经验,熟悉 MLIR/TileLang/Triton 等任一编译栈或高性能算子 DSL;理解常见编译优化技术,以及 GPU/NPU 等架构的并行执行模型、内存层级和矩阵计算单元等硬件架构特性。 5.在大型开源软件(如 LLVM、NCCL 和 PyTorch 等)中有深度贡献,或维护过其他个人开源软件。 6.在高性能计算相关赛事(如 SC/ASC/ISC 和 PAC 等)或算法竞赛(NOI/IOI 和 ICPC 等)中取得优异成绩。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring