岗位描述
岗位职责
1. 负责 V(T)LA-Vision (Tactile) Language Action模型的研发,将视觉感知、语言等多模态与动作决策进行统一建模
2. 设计并实现基于多模态大模型(VLM / LMM / LAM)的感知—理解—决策—控制算法框架
3. 构建和训练视觉-语言-动作联合模型,用于机器人操作、任务执行或智能体决策
4. 研究并落地 Imitation Learning、Reinforcement Learning、LLM-based Planning、Behavior Cloning 等算法
5. 参与真实/仿真环境(如 Mujoco / Isaac Sim / Habitat / CARLA)中的数据采集方案设计
6. 与系统,软件,硬件团队协作,完成算法在真实系统中的部署与优化
7. 跟踪并复现前沿论文(如Pi,RT-2、PaLM-E、Octo、OpenVLA 等),推动技术演进
岗位要求:
1.硕士及以上学历,计算机、自动化、机器人、人工智能等相关专业
2.扎实的 机器学习 / 深度学习 基础,熟悉 Transformer、Diffusion、Policy Learning 等模型。熟悉 计算机视觉 + 自然语言处理 + 强化学习 中至少两类方向
3.熟练使用 Python / PyTorch(或 JAX),具备良好的代码与实验习惯
4.具备较强的问题拆解能力、科研能力和工程落地能力
加分项:
1.有 VLA / 多模态大模型 / 具身智能 / 机器人学习 相关项目或论文经验
2.熟悉 LLM / VLM(如 GPT、LLaMA、CLIP、BLIP、GPT-4V) 的训练或微调
3.有机器人操作、导航、自动驾驶、Agent 系统 的实际经验
4.熟悉 强化学习(RL / IL / Offline RL) 或 控制理论
5.参加过 RoboCup、CVPR / ICLR / NeurIPS / RSS 等相关竞赛或会议
6.有大规模数据训练、分布式训练、模型部署经验者优先