Skip to content
← Back to job listings

AI平台研发-多模态数据湖开发岗(J29271)

Chery · 江苏省·南京市

External listingFull-time8 months ago

About The Role

  1. 多模态数据湖架构设计与落地

负责构建支持文本、图像、音频、视频等多模态数据的企业级数据湖架构,主导数据存储、元数据管理、计算引擎的技术选型与方案设计,确保数据湖的高可用、可扩展及高效查询性能。

  1. 核心组件二次开发与优化
  • 基于DolphinScheduler进行二次开发,设计多模态数据采集、清洗、转换的自动化调度流程,优化任务依赖管理与容错机制,支撑TB级多模态数据的批流一体化处理。
  • 对OpenMetadata进行定制化开发,扩展元数据模型以适配多模态数据(如图像特征、音频格式、视频帧信息等),实现多模态数据的血缘追踪、权限管控与资产目录管理。
  • 基于Kyuubi优化多模态数据查询引擎,集成SQL与向量检索能力,支持跨模态数据联合查询(如文本关键词+图像特征匹配),提升复杂查询的响应速度。
  1. 存储层集成与优化

主导Lance、Iceberg等新型列式存储与多模态数据湖的集成,设计多模态数据的存储schema(如文本元数据+向量嵌入+图像二进制的混合存储),优化存储分层策略(热数据Lance、冷数据Iceberg归档),解决多模态数据的高吞吐写入与低延迟读取问题。

  1. 数据处理流水线研发

基于Java与SpringCloud生态,开发多模态数据处理微服务(如数据接入服务、特征提取服务、检索服务),构建高并发、低耦合的分布式数据处理流水线,支撑业务场景下的多模态数据实时/离线处理需求。

  1. 技术难点攻坚与团队协作

跟踪多模态数据处理领域前沿技术(如向量检索、跨模态语义对齐),解决数据湖构建中的技术瓶颈(如多模态元数据一致性、高维向量存储效率);与算法团队、业务团队协作,将技术方案落地到实际业务场景(如智能内容检索、多模态分析)。

  1. 学历与工作经验
  • 统招211/985院校硕士及以上学历,计算机、软件工程、大数据相关专业;
  • 3-5年大数据平台或数据湖研发经验,有企业级多模态数据处理项目经验者优先。
  1. 核心技术能力
  • 精通Java编程语言,具备扎实的SpringCloud微服务开发经验,能独立设计并实现高可用分布式服务;
  • 具备DolphinScheduler、OpenMetadata、Kyuubi二次开发经验:熟悉三者的源码架构,能基于业务需求扩展核心功能(如DolphinScheduler的任务类型扩展、OpenMetadata的元数据模型定制、Kyuubi的查询优化器改造);
  • 熟悉Lance、Iceberg等新型存储引擎,有实际集成经验:能设计多模态数据的存储方案,理解Lance的向量存储特性与Iceberg的事务性、时间旅行能力,解决大规模数据的存储性能问题;
  • 了解多模态数据处理流程:熟悉文本分词、图像特征提取(如CLIP)、音频转码等基础处理逻辑,了解向量数据库(如Milvus)与数据湖的协同方案者优先;
  • 熟悉大数据生态:掌握Hadoop、Spark、Flink等计算框架,了解YARN/K8s资源调度,能排查分布式环境下的性能瓶颈。

3.软技能要求

  • 具备较强的问题分析与解决能力,能独立攻克数据湖构建中的复杂技术难题;
  • 良好的沟通协作能力,能跨团队推动技术方案落地,清晰输出技术文档;
  • 持续学习能力,关注大数据与多模态领域的技术演进,有技术创新意识。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing