岗位描述
【工作职责】
1. 构建下一代具备通用场景移动能力的大模型,负责移动基座多模态大模型的数据体系建设,设计并搭建大规模数据自动生产、清洗、标注及质量评估的端到端pipeline,为通用移动能力提供高质量数据燃料;
2. 研发数据驱动的模型能力Scale Up策略,包括预训练数据配比优化、SFT数据多样性挖掘、合成数据生成(如基于World Model/VLA的数据合成)等,构建覆盖全场景的移动数据资产;
3. 构建面向移动场景的多模态数据,涵盖图像、视频、文本、动作轨迹等多源异构数据,设计高效的数据检索与采样机制,支撑通用移动能力的持续数据供给;
4. 开发数据质量评估与调优工具链,建立数据-模型性能关联分析体系,指导数据采集团队的策略制定,确保数据质量与通用移动能力目标对齐;
5. 探索自动化数据标注、半监督学习、主动学习等技术,降低人工标注成本,提升数据生产效率和规模,加速通用移动能力的迭代演进。
【任职要求】
1. 计算机科学、数据科学、人工智能等相关专业本科及以上学历,具有大规模数据处理或多模态数据挖掘经验;
2. 熟悉数据工程全链路技术栈(Spark/Flink/Hadoop等),具备构建PB级数据处理pipeline的实践经验;
3. 了解学术界LLM,VLM,WM,VLA,CLIP等方向已有公开数据集优先;
4. 了解多模态大模型训练对数据的需求特性,掌握数据治理、去重、质量评估相关技术。