锦鲤求职

太极图形

AI Data Infrastructure Engineer

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1. 数据管道构建:设计并维护高可扩展的 ETL/ELT 管道,支持结构化及海量非结构化数据(图像、视频、3D/2D 资产)的摄入与处理。
2. 分布式系统优化:基于云对象存储及数据湖,应用 Spark / Ray / Flink 等框架优化数据处理,落地数据分片、缓存及完善的监控告警机制。
3. AI/ML 数据支持:负责模型预训练数据的预处理(格式转换、增强、特征提取等)与质量校验,保障数据集的 Lineage 与可复现性。
4. 基建与敏捷协同:运用 Terraform / Kubernetes 等 IaC 工具管理环境,推行 CI/CD 最佳实践;跨团队紧密协作,快速响应研发需求。

岗位要求
1. 资历与语言:5 年以上数据工程或分布式系统开发经验;具备基本英文沟通能力,能胜任全英会议与书面交流。
2. 数据管道构建:设计并维护高可扩展的 ETL/ELT 管道,支持结构化及海量非结构化数据(图像、视频、3D/2D 资产)的摄入与处理。
3. 分布式系统优化:基于云对象存储及数据湖,应用 Spark / Ray / Flink 等框架优化数据处理,落地数据分片、缓存及完善的监控告警机制。
4. AI/ML 数据支持:负责模型预训练数据的预处理(格式转换、增强、特征提取等)与质量校验,保障数据集的 Lineage 与可复现性。
5. 基建与敏捷协同:运用 Terraform / Kubernetes 等 IaC 工具管理环境,推行 CI/CD 最佳实践;跨团队紧密协作,快速响应研发需求。
加分项
* 熟悉大模型或机器学习训练全流程(Pre-training / Fine-tuning / RL)。
* 具备 3D/2D 资产处理经验(几何变换、纹理处理)或熟悉主流渲染引擎(Blender/Unity/Unreal)用于合成数据生成。 * 拥有 Kubernetes 分布式工作负载编排或 GPU / HPC 集群的实战经验。
* 深度使用过大型数据仓库/湖仓平台(Databricks / Snowflake / BigQuery 等)。
* 在 ML Infra、分布式系统方向有高质量的开源贡献,或熟悉数据安全与合规。

数据方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →