岗位描述
岗位职责
1.建设EB级多模态数据湖底座,统一管理文本、图片、视频、音频等 AI 数据,让海量训练数据可发现、可追溯、可复用。
2.研发通用大模型数据处理框架,支撑异构 CPU/GPU 集群上的大规模数据清洗、去重、标注、合成和批量推理,通过 Agent 驱动的数据处理方式,提升高质量数据生产与模型迭代效率。
3.打造 AI 数据分析引擎,建设融合 SQL、全文检索与向量检索的数据分析能力,帮助算法团队洞察数据分布、识别质量问题并持续优化训。
岗位要求
1.计算机相关专业背景,熟练掌握至少一门主流编程语言(Go / Python / Java 等),具备扎实的工程实现能力;
2.具备良好的技术热情与自驱力,面对复杂问题能够独立思考、快速学习,愿意在数据与大模型交叉领域持续深耕;
3.理解大数据技术体系,熟悉 Spark、Flink、Kafka、Hive、HDFS 等主流组件的原理与实践;
4.对大模型技术栈及产品生态有较为深入的了解,关注前沿进展;
5.熟悉数据中台、机器学习平台等系统级平台的开发或深度使用经验。