Skip to content
← Back to job listings

端侧AI Storage研究员/专家(J14572)

YMTC (Yangtze Memory) · 上海市, 湖北省·武汉市

External listingFull-timeabout 1 month ago

About The Role

【岗位职责】

  • LLM推理存储架构优化:主导端侧大模型的存储子系统研发,解决Flash/NVMe在推理过程中的带宽与延迟瓶颈,重点优化KV Cache的内存/磁盘分页交换(Offloading)机制。
  • 推理引擎深度适配:基于MNN等端侧框架,定制量化模型(INT4/INT8)的内存映射(mmap)与按需加载策略,实现“零拷贝”启动与低显存占用。
  • 新架构存储调度:针对MOE(混合专家)等稀疏架构,设计动态专家路由的存储调度算法,优化随机读写性能,降低首字延迟(TTFT)。
  • 软硬协同与功耗控制:构建端侧存储性能基准,通过预取、缓存替换算法及F2FS深度调优,最大化UFS/NVMe性能,同时降低推理功耗与Flash写入损耗。

【任职要求】

  • 学历背景:计算机、电子或相关专业硕士及以上,3年以上C/C++开发经验,深入理解Linux/Android内核及IO栈。
  • 核心技能:
  • o LLM推理精通:深刻理解Transformer及MOE架构,熟悉vLLM、llama.cpp、MNN等框架的底层内存管理机制(如PagedAttention原理)。
  • o 存储系统专家:精通计算机体系结构中的存储层级(Cache/DRAM/Flash),熟悉F2FS/EXT4文件系统及UFS/NVMe协议。
  • o 全栈优化能力:具备量化、算子融合、显存/内存优化实战经验,能独立完成从模型加载到推理生成的全链路存储优化。
  • 项目经验:有端侧大模型(手机/IoT/车机)落地经验,或主导过存储系统(文件系统/数据库/Flash控制器)研发项目。

【加分项】

  • 有llama.cpp (GGUF/mmap)、vLLM源码贡献或MNN深度定制经验。
  • 熟悉CUDA编程、GPU架构,或了解CXL、存算一体(PIM)技术。
  • 在顶级会议发表过LLM系统优化相关论文,或拥有相关发明专利。
  • 具备英语前沿论文追踪能力,能快速复现最新存储优化算法。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing