岗位描述
职位描述:
1. 负责面向飞行器、扫地机等设备场景的具身智能基础模型预训练;
2. 参与 VLA、World Model、Video Model、多模态时序模型等模型架构设计;
3. 负责视觉、语言、视频、动作、轨迹、传感器、地图等多模态数据的表征学习和统一建模;
4. 设计预训练任务,包括图文/视频语言对齐、视频预测、状态预测、动作预测、轨迹建模、masked modeling、自监督学习等;
5. 负责训练数据清洗、配比、采样、tokenization、质量评估和训练实验迭代;
6. 参与大规模分布式训练,解决训练稳定性、收敛效率、模型泛化等问题;
7. 与后训练和端侧部署团队协作,保证预训练模型可以支撑真实任务适配,并具备硬件友好性。
任职要求:
必备能力
1. 多模态预训练经验:熟悉 VLM、Video LLM、LLM、Diffusion、Transformer、SSM 等模型,有实际训练或深度研究经验;
2. 大规模训练能力:熟悉 PyTorch/JAX,了解分布式训练、混合精度、数据并行/模型并行、训练稳定性调优;
3. 数据构建能力:能处理大规模图像、视频、文本、时序数据,熟悉数据清洗、采样、配比、过滤、质量评估;
4. 时序/视频建模能力:具备视频理解、视频生成、状态预测、长期时序建模相关经验,能够迁移到飞行器/扫地机任务;
5. 多模态对齐能力:理解视觉、语言、视频、动作等模态如何对齐,能够设计合适的训练目标和模型接口;
6. 硬件友好意识:了解模型尺寸、推理延迟、端侧算力、量化/蒸馏等约束,能在模型设计阶段避免纯云端大模型思路。
加分经验
1. 有 VLM/Video LLM/多模态 Agent、 World Model、视频预测、环境动态预测相关经验;
2. 做过具身智能、机器人学习、3D/空间智能相关研究;
3. 有顶会论文、开源模型、大规模训练项目经验;
4. 有模型压缩、蒸馏、端侧友好结构设计经验。