← Back to job listings
UC
大模型推理优化工程师
UCloud · 上海市
About The Role
- 大模型推理优化工程师
- 职位描述
- 负责LLM/VLM大模型的部署与推理性能优化,系统性降低硬件延迟瓶颈,保障高并发下线上服务稳定性(TTFT与TPOT满足SLA要求)。
- 探索前沿推理加速技术,推动在新型GPU/NPU等硬件上的落地。
- 职位要求
- 精通Python,熟悉C++,具备高性能代码开发与算法实现能力。
- 至少具备以下2个领域中的实践经验:
- a. Transformers与Diffusers库,深入理解Attention变体(GQA、MLA、Linear Attn、Sparse Attn)及其优化技术(FlashAttention、PagedAttention);
- b. GPU编程(CUDA/cutlass/Triton/TileLang开发)且掌握性能分析工具(Nsight、PyTorch Profiler等);
- c. 模型压缩(量化、稀疏化、知识蒸馏);
- d. GPU集群通信架构(卡间通信NVLink/PCIe,机间通信RDMA/RoCE),理解NCCL、HCCL等通信库的工作机制;
- 符合以下条件者优先:
- a. 有超大规模模型(1T参数以上)的分布式部署经验;
- b. 有推理系统经验,如为vLLM、SGLang、TensorRT-LLM贡献过核心PR;
- c. 有投机采样(Speculative Decoding)的落地与优化经验(如EAGLE、DFlash等);
- d. 有相关开源项目、专利或论文发表;
- e. 有国产芯片(如昇腾、海光等)的在线服务加速经验。
- 良好的团队协作能力与工程落地能力,对技术有持续热情。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring