← Back to job listings
SU
资深优化专家(郑州)(J13672)
Sugon · 河南省·郑州市
About The Role
- 研发高质量的芯片基础软件栈,包括支撑大语言模型在内的深度学习,线性代数,科学计算,信号处理等方向的基础加速库;
- 分析重要的性能指标,调优已有软件算法,并且对未来的软件进行优化和提升;
- 对大语言模型,CV模型,语音模型,推荐系统,科学计算和其他相关并行算法领域进行分析和优化;
- 负责 AI模型推理/训练的端到端性能整体优化;
- 实现AI/科学计算领域在GPGPU上的算法和实践。
6.参与主流大模型(DeepSeek、通义、LLaMA等)的推理算子开发和优化,提高大模型推理性能;参与W8A8 等量化算法的研究和相应高性能算子开发;参与投机采样、MTP、专家负载均衡、计算/通信 Overlap 等创新推理优化特性的研发;
- 熟悉 C++编程,了解常用数据结构及算法;
- 熟悉线性代数,科学计算,机器学习,深度学习,AI算法等一个或多个领域;
- 熟悉 GPU 或 AI加速芯片的体系结构,有过在不同架构芯片上的算法调优经验;
- 熟悉并行算法优化的基本技巧,有对算法性能进行分析和优化的经验;
- 熟悉计算机体系结构,操作系统;
- 以下情况优先:
- (1)GPU的编程和优化经验,e.g. CUDA or OpenCL,有过类CUDA生态的底层计算库(cuBLAS/cuDNN/cuFFT/cuSOLVER等)的开发经验,或者对这些计算库的构成和使用非常熟悉;
- (2)有过机器学习方面的开发经验,尤其是深度学习,熟悉Tensorflow, Pytorch, TensorRT等框架/引擎的原理和使用方法;
- (3)熟悉convolution、GEMM、Attention等计算密集型运算的典型算法,有过实际开发经验优先,有过视觉/大语言模型的开发和调优经验,熟悉CNN/Transformer等网络的性能瓶颈和优化方向,能够把握相关领域的国际前沿发展趋势;
- (4)有过数据科学,统计科学,图像处理,信号处理等方面的开发和优化经历;
- (5)有软硬件协同优化、基于异构硬件的软件开发经验者优先。
- (6)具备 NPU/GPU 等 AI 加速器的性能调优经验,熟悉内存优化、算子融合等技术。熟悉 AI 推理框架,有模型部署和优化实战经验。
- (7)参与过 Triton、MLIR、IREE、XLA、TVM、TorchInductor 等编译器的开发,或在 GitHub 提交过相关 PR。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring