锦鲤求职

星尘智能

大模型算法研究员(RL)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责:

- 负责具身大模型(VLA/世界模型)后训练中的分布式系统架构设计、吞吐量和效率优化、多机多卡多核scaling。

- 负责后训练中的神经网络架构研发。熟悉主流VLA/世界模型的架构,在此基础上为后训练做专属的surgery.

- 负责真机强化学习。打通机器人控制到在线学习算法运转的全链路,专属harness engineering、专属代码框架设计、实验调优。

- 负责真机后训练的autoresearch。调研和研发真机上后训练的loop engineering(如ENPIRE等autoresearch类的算法)

- 负责模拟器搭建。熟悉Isaac/genesis world/MuJoCo等业界SOTA,为大规模并行RL开发拟真、高速模拟器完成sim2real。

- 负责后训练中的评测环境搭建。设计模拟器、真机等分层评测体系,搭建和运维一键提交式评测平台,维护内部/外部的算法、模型榜单。

任职要求:

- 本科及以上学历,计算机科学、电子工程、自动化、机械工程、应用数学(计算力学)等相关专业。

- 对强化学习基础知识和概念有较深理解,如off-/on-policy, value, advantage, policy gradient, actor-critic等。

- 理解大模型分布式训练原理,对数据并行、张量并行、流水线并行、序列并行等分布式策略有深入研究与实战经验。

- 有强化学习代码框架和多机多卡多核并行训练的使用经验。

- 熟练掌握Python, C/C++等编程语言,熟悉PyTorch等主流深度学习框架的底层实现,具备良好的工程开发规范与系统设计能力。

- 具备良好的问题排查能力与技术攻坚能力,有强烈的技术自驱力与团队协作意识。

加分项:

- 在NeurIPS/ICML/ICLR/CVPR/ECCV/ICCV/ICRA/IROS/CoRL等行业顶会或顶刊上有发表记录。

- 知名开源AI框架/项目的核心贡献者。

- 掌握vibe coding, agentic coding并重度或全量使用。针对手头的代码开发、算法实验验流程等日常工作开发过agentic workflow, skill, agent team等。

- 有AI算法机器人真机部署的经验。

- 有模拟器开发或其中的场景定制的实际经验。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →