岗位描述
核心职责:
研发先进的 Vision-Language-Action (VLA) 多模态算法,设计端到端的训练与推理框架。
探索多模态表征学习、跨模态对齐、动作生成等关键技术(如基于Transformer、Diffusion Model等架构的模型优化)。
针对具体场景(如机械臂控制)设计高效的模型压缩与部署方案。
跟踪学术界与工业界最新进展(如GPT-4V、RT-X、V-JEPA等),推动技术落地。
任职要求
必备条件:
教育背景: 计算机科学、人工智能、电子工程等相关专业硕士及以上学历。
技术能力:
扎实的深度学习基础,熟悉PyTorch/TensorFlow框架。
在多模态领域(CV+NLP)有实际项目经验,熟悉CLIP、BLIP、Flamingo等模型。
熟悉强化学习(RL)、模仿学习(IL)或动作生成技术者优先。
工程能力: 具备模型训练优化、分布式训练、ONNX/TensorRT部署经验。
语言能力: 熟练阅读英文论文,复现或改进前沿算法。
加分项:
在顶级会议(CVPR/ICML/NeurIPS/ICLR等)发表过多模态相关论文。
有机器人、自动驾驶、具身智能(Embodied AI)项目经验。
熟悉多模态数据集(如Ego4D、Something-Something、CALVIN等)。
我们提供
与顶尖AI团队合作的机会,参与高影响力项目。
国际化的技术氛围,充足的算力资源(GPU集群)。
有竞争力的薪资与成长空间。