← Back to job listings
UC
算法工程师 (高性能计算与大模型推理优化方向)
UCloud · 上海市, 广东省·深圳市
About The Role
我们正在寻找一位对技术充满好奇心、渴望探索未知领域的算法工程师加入我们的团队。在这个岗位上,你将不再局限于应用层的模型调参,而是深入到从模型框架到底层硬件的完整调用链路中。你将负责剖析、优化并构建高性能的大模型推理与训练系统,同时为顶尖客户提供深度的技术支持。如果你热衷于探究 torch 乃至 cuda 底层的运行机制,并乐于解决复杂的工程难题,这里将是你施展才华的最佳舞台。
核心职责 (Key Responsibilities)
- 全链路性能优化与研究(核心重点):
- 深入研究并优化从上层框架(vLLM/Sglang)到 PyTorch,再到 CUDA/NCCL 以及底层硬件(GPU/网络互联)的完整调用链路。
- 针对大模型推理和分布式训练场景,搭建性能理论模型(Performance Modeling),识别系统瓶颈。
- 设计并实现精细化的性能监控系统,量化分析算力利用率(MFU/HFU)及通信开销。
- 深度技术支持与问题排查:
- 协助客户定位主流开源代码在推理或训练过程中遇到的复杂 Bug。
- 排查分布式环境下的机器故障(软硬件结合问题),保障集群稳定性。
- 为客户提供定制化的性能优化与加速方案,提升模型落地效率。
- 模型复现与微调实践:
- 基于 PyTorch 等框架,从零搭建或深度定制经典及前沿模型(如 Transformer 架构、Stable Diffusion、YOLO 等)。
- 负责相关模型的微调(Fine-tuning)与适配工作,验证优化策略的有效性。
- 教育背景:
- 计算机科学、人工智能、计算机视觉、机器学习或相关领域的硕士或博士学位。
- 技术栈要求:
- 框架经验: 熟练掌握并实际使用过至少 2 种以上主流的模型推理或分布式训练框架(例如:vLLM, Sglang, Accelerate, Megatron-LM, DeepSpeed 等)。
- 编码与实现: 精通 Python/C++,具备扎实的 PyTorch 功底。必须具备从模型搭建开始实现 ResNet 或更先进模型(如 Transformer 系列、YOLO、Stable Diffusion)训练或微调的实际动手经验。
- 软性素质:
- 拥有极强的好奇心与探索欲,不满足于“知其然”,更追求“知其所以然”。
- 习惯挑战未知领域,具备在文档缺失或技术前沿地带独立解决问题的能力。
- 具备良好的沟通能力,能够清晰地向客户解释复杂的技术问题。
加分项 (Preferred Qualifications)
- 有高性能计算(HPC)、CUDA 算子编写或优化经验者优先。
- 熟悉 GPU 硬件架构(如 NVIDIA Ampere/Hopper)及互联技术(NVLink/InfiniBand)者优先。
- 有大规模分布式训练集群运维或性能调优工作经验者优先。
- 在 GitHub 上有高质量开源项目贡献,或在相关技术社区活跃者优先。
- 为什么加入我们?
- 硬核技术挑战: 你将直接面对大模型时代最核心的算力效率问题,工作内容极具技术深度。
- 全栈视野: 这是一个难得的机会,让你打通从算法应用到底层硬件的“任督二脉”,成为真正的全栈优化专家。
- 成长空间: 与一群同样充满好奇心和极客精神的伙伴共事,共同探索 AI 基础设施的边界。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring