Skip to content
← Back to job listings

语音大模型数据工程师

step · 海淀区, 北京市, 中国; 徐汇区, 上海市, 中国

External listingfull-time5 months ago

About The Role

工作职责 设计、搭建并持续迭代语音大模型数据处理与生产管线,覆盖数据采集、清洗、标注、质检与版本管理,持续产出高质量训练数据。 构建并维护大规模语音数据的自动化处理与质量控制流程,保障数据的稳定性、一致性和可追溯性。 与算法紧密合作,理解模型训练需求,将模型问题转化为可执行的数据生产与优化方案。 推动数据生产流程的工程化与平台化,提高数据处理效率与数据复用能力。 跟踪语音大模型及多模态方向的最新数据构建方法,将有效的数据策略快速落地到实际训练中。 职位要求 本科及以上学历,计算机、人工智能、电子信息或相关专业。 熟练掌握 Python / Java / Go / C++ 中至少一门语言,具备独立编写数据处理脚本和构建工具的能力。 熟悉常见数据处理与分析工具,如 SQL / Pandas / Spark / Hadoop 等,有大规模数据处理经验者优先。 对语音相关任务有比较深入的认知,了解大模型训练流程,对数据在模型效果中的作用有清晰理解。 具备良好的工程意识、问题拆解能力和跨团队沟通协作能力。

This is an external listing. JobSpring does not represent or verify the employer. Report this listing