岗位描述
岗位职责
负责机器人大模型的训练、推理和评测基础设施研发,为算法团队提供从数据、训练到云端 / 端侧部署的高效稳定工程底座。
1、大规模训练系统:设计和优化 LLM / VLA / World Action Model 的分布式预训练与后训练框架,解决千卡规模下多模态数据加载、通信、调度、容错等问题;
2、Agentic RL 训练系统:构建支持 Agent 与仿真 / 真机环境大规模并行交互的强化学习训练框架,打通 rollout、reward、训练的高吞吐闭环;
3、推理优化与部署:面向云端 GPU 和自研端侧芯片进行大模型推理性能优化,包括算子优化、量化、编译与调度,满足机器人实时控制的时延要求;
4、训练评测与研发效能:建设多模型类型(LLM / VLM / VLA)的自动化评测体系,以及实验追踪、模型版本管理、集群资源调度等平台能力。
岗位要求
1、2027 届本科及以上学历,计算机、软件工程、电子信息等相关专业,硕士优先;
2、扎实的编程基础,熟练使用 Python,熟悉 C++ / Go 至少一门;
3、具备良好的计算机系统基础(操作系统、并行计算、计算机体系结构等),有较强的动手能力和问题定位能力;
4、理解大模型训练(Pretrain / SFT / RL)和推理的基本流程;
5、对机器人 / 具身智能方向有热情,愿意在真实系统中解决工程难题。
加分项(满足任意一项即可)
-分布式训练相关经验(Megatron-LM / DeepSpeed / FSDP);
-GPU 编程与高性能计算(CUDA / Triton / NCCL / RDMA);
-模型推理优化(vLLM / SGLang / TensorRT / 量化 / 端侧部署);
-ML 平台或调度系统开发(Kubernetes / Ray / Slurm);
-机器人仿真环境(Isaac / MuJoCo)或 RL 训练框架使用经验;
-相关方向的开源贡献、论文、竞赛获奖或实习经历。