Skip to content
← Back to job listings

算法工程师 (高性能计算与大模型推理优化方向)

UCloud · 上海市, 广东省·深圳市

External listingFull-time7 months ago

About The Role

我们正在寻找一位对技术充满好奇心、渴望探索未知领域的算法工程师加入我们的团队。在这个岗位上,你将不再局限于应用层的模型调参,而是深入到从模型框架到底层硬件的完整调用链路中。你将负责剖析、优化并构建高性能的大模型推理与训练系统,同时为顶尖客户提供深度的技术支持。如果你热衷于探究 torch 乃至 cuda 底层的运行机制,并乐于解决复杂的工程难题,这里将是你施展才华的最佳舞台。

核心职责 (Key Responsibilities)

  • 全链路性能优化与研究(核心重点):
  • 深入研究并优化从上层框架(vLLM/Sglang)到 PyTorch,再到 CUDA/NCCL 以及底层硬件(GPU/网络互联)的完整调用链路。
  • 针对大模型推理和分布式训练场景,搭建性能理论模型(Performance Modeling),识别系统瓶颈。
  • 设计并实现精细化的性能监控系统,量化分析算力利用率(MFU/HFU)及通信开销。
  • 深度技术支持与问题排查:
  • 协助客户定位主流开源代码在推理或训练过程中遇到的复杂 Bug。
  • 排查分布式环境下的机器故障(软硬件结合问题),保障集群稳定性。
  • 为客户提供定制化的性能优化与加速方案,提升模型落地效率。
  • 模型复现与微调实践:
  • 基于 PyTorch 等框架,从零搭建或深度定制经典及前沿模型(如 Transformer 架构、Stable Diffusion、YOLO 等)。
  • 负责相关模型的微调(Fine-tuning)与适配工作,验证优化策略的有效性。
  • 教育背景:
  • 计算机科学、人工智能、计算机视觉、机器学习或相关领域的硕士或博士学位。
  • 技术栈要求:
  • 框架经验: 熟练掌握并实际使用过至少 2 种以上主流的模型推理或分布式训练框架(例如:vLLM, Sglang, Accelerate, Megatron-LM, DeepSpeed 等)。
  • 编码与实现: 精通 Python/C++,具备扎实的 PyTorch 功底。必须具备从模型搭建开始实现 ResNet 或更先进模型(如 Transformer 系列、YOLO、Stable Diffusion)训练或微调的实际动手经验。
  • 软性素质:
  • 拥有极强的好奇心与探索欲,不满足于“知其然”,更追求“知其所以然”。
  • 习惯挑战未知领域,具备在文档缺失或技术前沿地带独立解决问题的能力。
  • 具备良好的沟通能力,能够清晰地向客户解释复杂的技术问题。

加分项 (Preferred Qualifications)

  • 有高性能计算(HPC)、CUDA 算子编写或优化经验者优先。
  • 熟悉 GPU 硬件架构(如 NVIDIA Ampere/Hopper)及互联技术(NVLink/InfiniBand)者优先。
  • 有大规模分布式训练集群运维或性能调优工作经验者优先。
  • 在 GitHub 上有高质量开源项目贡献,或在相关技术社区活跃者优先。
  • 为什么加入我们?
  • 硬核技术挑战: 你将直接面对大模型时代最核心的算力效率问题,工作内容极具技术深度。
  • 全栈视野: 这是一个难得的机会,让你打通从算法应用到底层硬件的“任督二脉”,成为真正的全栈优化专家。
  • 成长空间: 与一群同样充满好奇心和极客精神的伙伴共事,共同探索 AI 基础设施的边界。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing