岗位描述
工作内容:
数据管线开发:使用 Spark/Flink 参与自动驾驶车端回传数据的 ETL(提取、转换、加载)流水线开发。
湖仓日常运维:参与分布式存储与湖仓表(如 Iceberg/Hudi)的日常维护、Schema 变更与数据校验。
查询支持与优化:协助算法团队编写高效的 SQL 查询,提取训练所需的元数据,逐步参与查询性能调优。
岗位要求:
教育背景:计算机、软件工程、数据科学、信息管理等相关专业。
SQL基本功:精通 SQL,能够熟练编写复杂的查询语句,理解基本的数据库原理(索引、事务、执行计划)。
开发语言:熟悉 Java、Scala 或 Python 至少一种,具备扎实的面向对象编程思想。
大数据概念:了解大数据生态的基本概念,知道 Hadoop、Spark 或 Hive 的基本原理,并在学校或实验室环境中有过简单的使用经验。
加分项:
了解数据湖(Apache Iceberg / Hudi / Delta Lake)的开源概念,或者在 Linux 下搭建过 Hadoop/Spark 伪分布式集群。
具备良好的沟通能力和文档习惯,对非结构化数据(视频、音频、点云)管理感兴趣。