岗位描述
岗位职责
1. 负责自动驾驶及 AI 大模型数据基础设施的架构设计与能力研发,构建支撑海量数据规模的稳定、高效平台能力。
2. 研发大规模分布式数据管理平台,覆盖结构化、非结构化多类型数据的高效存取、处理与生命周期治理。
3. 构建高吞吐、低延迟的并行数据处理框架,支撑多模态数据的大规模预处理、转换、过滤与质量评估。
4. 设计并实现自动化数据管线(Data Pipeline),打通数据采集、清洗、标注、训练、交付的全链路流程,提升数据闭环效率。
5. 持续优化平台性能、可靠性与可扩展性,保障数据基础设施对算法研发和模型训练的稳定支撑。
岗位要求
1. 深度认可数据驱动的研发范式,深刻理解数据闭环的原理与架构体系。
2. 计算机科学、软件工程、分布式系统等相关专业硕士及以上学历,或具备同等工程能力的工作经验。
3. 扎实的编程基础,精通 Python,熟悉C++ 、Go 等编程语言;具备良好的工程设计与架构能力。
4. 深入理解分布式系统原理,熟悉大规模存储系统(如对象存储、分布式文件系统、数据湖仓)、大规模数据处理框架(如 Spark、Ray、Flink),有云原生基础设施(Kubernetes、容器化)和异构计算(GPU 集群调度、存算分离)相关经验,熟悉数据管线与工作流调度体系(如Argo、Airflow)。
5. 熟悉元数据管理、数据血缘、数据质量、数据可观测性、版本管理等平台能力建设技术方案。
6. 对自动驾驶充满热情,具备良好的团队协作能力、沟通表达能力、抗压能力,能识别关键问题并推动解决。
7. 具备自动驾驶、计算机视觉或 AI 训练数据基础设施经验者优先。