AI数据产品开发
geely · 慈溪市, 浙江, 中国
About The Role
核心职责 主导AI数据产品全生命周期开发,覆盖数据采集、处理、标注、存储、建模赋能及可视化全流程,聚焦AI模型训练与推理的数据供给、数据质量优化及数据价值转化。 负责AI数据产品的核心功能设计与落地,包括数据采集方案(结构化/非结构化数据)、数据清洗与增强策略、标注工具选型与定制、数据集管理体系搭建等,输出可落地的技术方案与开发文档。 对接AI算法团队,明确模型训练、微调、推理的数据需求(如数据规模、格式、质量指标、隐私等级),设计适配大模型、垂直领域模型的数据供给方案,保障数据与模型的高效适配。 搭建AI数据质量管控体系,制定数据准确性、完整性、一致性、时效性、安全性等核心指标,设计数据校验、异常检测与修复机制,通过技术手段提升AI模型输入数据质量,降低数据噪声对模型效果的影响。 负责AI数据产品的技术架构设计与优化,包括数据存储架构(时序数据库、向量数据库、分布式存储等)、数据处理流水线搭建(批处理/流处理)、数据标注平台开发与集成,平衡数据处理效率、存储成本与模型需求。 推动AI数据工具链的建设与迭代,包括自动化数据采集脚本、智能标注工具、数据集版本管理工具、数据质量监控面板等,提升数据生产效率与团队协作效率。 结合RAG、多智能体、模型量化等AI技术特性,优化数据产品方案,如为RAG场景设计向量数据库检索策略、为本地模型部署提供轻量化数据集解决方案,助力AI能力高效落地。 负责AI数据产品的数据安全与合规开发,落实数据脱敏、加密存储、访问权限管控等措施,确保数据采集、使用、流转全流程符合隐私保护法规及行业规范,平衡数据可用性与安全合规。 建立数据产品效果评估体系,通过模型训练效果数据(如准确率、召回率)、数据处理效率指标(如处理吞吐量、标注效率)、数据质量指标驱动产品迭代,持续优化数据对AI业务的赋能效果。 关注AI数据领域技术趋势(如自动化数据标注、合成数据生成、联邦学习在数据共享中的应用)与行业竞品动态,输出数据产品技术创新与差异化方案,支撑AI业务核心竞争力构建。 任职要求 计算机科学、数据科学、统计学、软件工程等相关专业本科及以上学历。 5年以上数据产品开发、数据工程或AI数据相关工作经验,其中至少2年AI数据产品(如数据集管理平台、AI数据标注工具、数据增强系统)设计与落地经验。 深刻理解AI模型训练与推理的数据需求,熟悉大模型(如Transformer架构)、RAG、多智能体等技术的数据适配逻辑,掌握AI数据全流程管理的核心难点与解决方案。 具备扎实的数据处理技术能力,熟练掌握Python/Java等编程语言,精通SQL,熟悉Hadoop、Spark、Flink等大数据处理框架,了解向量数据库(如Milvus、Pinecone)、时序数据库的应用场景与部署方案。 熟悉AI数据标注流程与工具,了解自动标注、半监督标注技术原理,能独立设计标注规则、优化标注效率,有标注工具定制开发经验者优先。 具备数据质量管控体系搭建经验,能制定科学的数据质量指标,设计数据校验、异常修复机制,通过技术手段保障AI模型输入数据的可靠性。 了解AI数据安全与合规要求,熟悉数据脱敏、加密、访问控制等技术,能在产品开发中落实隐私保护政策,确保数据使用符合相关法规。 具备较强的跨团队协作能力,能高效对接算法、产品、研发团队,明确数据需求、协调技术资源,推动AI数据产品从需求到落地的全流程推进。 具备数据驱动思维,能通过分析数据处理效率、数据质量、模型效果等数据,定位产品问题并推动迭代优化,有完整的AI数据产品迭代案例者优先。 加分项 有本地大模型(如LLaMA、Qwen轻量化版本)数据集定制、优化及部署配套数据产品开发经验者优先。 具备AI+垂直场景(汽车领域)数据产品落地经验,熟悉垂直领域数据特性与需求者优先。 了解数据增强、合成数据生成、模型蒸馏等技术,能结合业务需求设计数据优化方案,提升模型效果者优先。 主导过AI数据产品从0到1搭建,包括需求分析、架构设计、开发落地及迭代优化,有完整项目闭环经验者优先。 有开源AI数据项目开发经验,或在技术社区分享过AI数据产品开发、数据处理优化相关内容者优先。 具备机器学习基础,能协助算法团队进行数据预处理、特征工程,参与模型效果调优者优先。
This is an external listing. JobSpring does not represent or verify the employer. Report this listing
JobSpring