岗位描述
岗位职责
岗位职责:
1.负责视觉-语言-动作(VLA)大模型的架构设计、预训练与微调,实现从多模态输入到机器人控制指令的端到端映射。
2.负责机器人多模态数据(视频、文本指令、关节状态、触觉等)的清洗、对齐与高效数据流水线建设,构建高质量行为克隆数据集。
3.研发并优化大模型的微调策略(如 LoRA、Prompt Tuning),结合模仿学习或强化学习,提升 VLA 模型在未知场景和物体上的泛化能力。
4.推进 VLA 大模型在轻量化边缘端(如 NVIDIA Jetson 系列)的量化与剪枝,实现低延迟的真机实时闭环控制(Real-time Closed-loop Control)。
岗位要求
岗位要求:
1.硕士及以上学历,计算机、人工智能、自动控制等相关专业,有深度学习/具身智能顶会论文(CVPR、NeurIPS、ICRA、IROS 等)者优先。
2.精通 PyTorch / TensorFlow,深入理解主流视觉大模型(ViT)和语言大模型(Transformer 架构),并具备大规模模型训练与调优经验。
3.熟悉具身智能常用算法,熟练掌握模仿学习(Diffusion Policy、ACT)、扩散模型或大模型驱动的轨迹规划方法。
4.熟练掌握 Python 编程与 Linux 环境,了解主流具身智能仿真环境(如 RoboSuite、ManiSkill、Isaac Lab)及 ROS/ROS2 框架。