Skip to content
← Back to job listings

大模型推理优化工程师

UCloud · 上海市

External listingFull-time3 months ago

About The Role

  • 大模型推理优化工程师
  • 职位描述
  • 负责LLM/VLM大模型的部署与推理性能优化,系统性降低硬件延迟瓶颈,保障高并发下线上服务稳定性(TTFT与TPOT满足SLA要求)。
  • 探索前沿推理加速技术,推动在新型GPU/NPU等硬件上的落地。
  • 职位要求
  1. 精通Python,熟悉C++,具备高性能代码开发与算法实现能力。
  2. 至少具备以下2个领域中的实践经验:
  • a. Transformers与Diffusers库,深入理解Attention变体(GQA、MLA、Linear Attn、Sparse Attn)及其优化技术(FlashAttention、PagedAttention);
  • b. GPU编程(CUDA/cutlass/Triton/TileLang开发)且掌握性能分析工具(Nsight、PyTorch Profiler等);
  • c. 模型压缩(量化、稀疏化、知识蒸馏);
  • d. GPU集群通信架构(卡间通信NVLink/PCIe,机间通信RDMA/RoCE),理解NCCL、HCCL等通信库的工作机制;
  1. 符合以下条件者优先:
  • a. 有超大规模模型(1T参数以上)的分布式部署经验;
  • b. 有推理系统经验,如为vLLM、SGLang、TensorRT-LLM贡献过核心PR;
  • c. 有投机采样(Speculative Decoding)的落地与优化经验(如EAGLE、DFlash等);
  • d. 有相关开源项目、专利或论文发表;
  • e. 有国产芯片(如昇腾、海光等)的在线服务加速经验。
  1. 良好的团队协作能力与工程落地能力,对技术有持续热情。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing