锦鲤求职

星尘智能

多模态数据研究工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

【岗位职责】

1. 负责 Ego、视频、多模态及互联网数据在具身智能模型训练中的前沿预研;

2. 持续跟进 Ego Video、Video Understanding、VLM、VLA、World Model 等方向的最新论文、数据集和开源工作;

3. 挖掘和评估适用于具身模型训练的开源及互联网多模态数据,包括第一视角视频、人类操作视频、手物交互、空间理解等数据;

4. 建立不同类型数据的分析和 Benchmark 体系,研究其在物体理解、动作理解、空间理解、任务规划等能力上的价值;

5. 研究 Ego 数据向机器人训练数据迁移的方法,包括数据筛选、任务抽取、Action / Object / State 标注、时序切分及语义结构化;

6. 开展数据实验,验证不同数据来源、数据类型、数据规模及数据配比对 VLM / VLA 等模型能力的影响;

7. 与数据算法、模型训练团队合作,将有价值的数据和预研方向转化为实际训练方案;

8. 持续探索新的多模态数据来源和数据范式,为具身模型预训练和能力扩展提供数据储备。

【任职要求】

1. 计算机、人工智能、机器人、自动化等相关专业本科及以上学历;

2. 熟悉 Python、PyTorch,具备基本的深度学习模型训练与实验能力;

3. 对 VLM、Video Understanding、Embodied AI、VLA、World Model 等至少一个方向有较深入理解;

4. 具备较强的论文阅读、技术调研和实验验证能力;

5. 能够独立完成从“问题提出 → 数据调研 → 实验设计 → 模型验证 → 结论分析”的完整预研过程;

6. 对数据敏感,能够从模型能力视角判断不同数据的潜在价值,而不仅是统计数据规模;

7. 具备良好的技术判断力和快速学习能力。

【加分项】

1.有 Ego / First-Person Video 相关研究或项目经验;

2.有 Ego4D、EPIC-KITCHENS、HOI、Human-Object Interaction 等数据使用经验;

3.有视频理解、动作识别、时序建模、Visual Grounding 等经验;

4.有 VLM / VLA 训练、Continual Pretraining 或数据配比实验经验;

5.有大规模互联网视频数据处理或 Dataset Curation 经验;

6.有机器人操作、具身智能、World Model 等相关研究经历;

7.有相关论文、开源项目或数据集建设经验。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →