← Back to job listings
Y(
端侧AI Storage研究员/专家(J14572)
YMTC (Yangtze Memory) · 上海市, 湖北省·武汉市
About The Role
【岗位职责】
- LLM推理存储架构优化:主导端侧大模型的存储子系统研发,解决Flash/NVMe在推理过程中的带宽与延迟瓶颈,重点优化KV Cache的内存/磁盘分页交换(Offloading)机制。
- 推理引擎深度适配:基于MNN等端侧框架,定制量化模型(INT4/INT8)的内存映射(mmap)与按需加载策略,实现“零拷贝”启动与低显存占用。
- 新架构存储调度:针对MOE(混合专家)等稀疏架构,设计动态专家路由的存储调度算法,优化随机读写性能,降低首字延迟(TTFT)。
- 软硬协同与功耗控制:构建端侧存储性能基准,通过预取、缓存替换算法及F2FS深度调优,最大化UFS/NVMe性能,同时降低推理功耗与Flash写入损耗。
【任职要求】
- 学历背景:计算机、电子或相关专业硕士及以上,3年以上C/C++开发经验,深入理解Linux/Android内核及IO栈。
- 核心技能:
- o LLM推理精通:深刻理解Transformer及MOE架构,熟悉vLLM、llama.cpp、MNN等框架的底层内存管理机制(如PagedAttention原理)。
- o 存储系统专家:精通计算机体系结构中的存储层级(Cache/DRAM/Flash),熟悉F2FS/EXT4文件系统及UFS/NVMe协议。
- o 全栈优化能力:具备量化、算子融合、显存/内存优化实战经验,能独立完成从模型加载到推理生成的全链路存储优化。
- 项目经验:有端侧大模型(手机/IoT/车机)落地经验,或主导过存储系统(文件系统/数据库/Flash控制器)研发项目。
【加分项】
- 有llama.cpp (GGUF/mmap)、vLLM源码贡献或MNN深度定制经验。
- 熟悉CUDA编程、GPU架构,或了解CXL、存算一体(PIM)技术。
- 在顶级会议发表过LLM系统优化相关论文,或拥有相关发明专利。
- 具备英语前沿论文追踪能力,能快速复现最新存储优化算法。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring