锦鲤求职

北京银河通用机器人股份有限公司

具身agent算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责:

1、负责具身 Agent 核心算法的设计与迭代,涵盖任务理解与分解、规划决策、工具与 Skill 使用、记忆与上下文管理、反思纠错等关键能力。

2、参与具身 Agent OS 的算法架构设计与升级,建立感知、认知、决策、执行和反馈之间的协同机制,提升 Agent 的通用性、可扩展性、稳定性及自主决策能力。

3、面向各类具身交互场景,研究多模态感知、语言理解、环境状态建模与机器人行为决策之间的闭环算法,提升复杂、动态和不确定环境下的交互效果。

4、研究长程任务执行中的状态跟踪、动态规划、异常恢复和安全约束等问题,提高 Agent 在连续交互过程中的任务完成率与鲁棒性。

5、建设具身 Agent 的数据与评测闭环,包括交互数据采集、行为轨迹构建、能力评测、真实环境验证及失败案例分析,推动算法持续迭代。

6、开展 Agentic 模型训练与 Agentic RL 相关工作,包括训练数据构建、SFT、奖励设计、轨迹评估、策略优化和模型后训练,提升模型在具身环境中的规划、推理、工具使用与自主决策能力。

任职要求:

1、计算机、人工智能、自动化、机器人或相关专业背景;不对学历和工作年限设置绝对限制,以实际能力、项目成果和研究深度为主要评价依据。

2、在以下至少一个方向具备扎实的理论基础和实践经验:

大模型 Agent 或 Agentic AI

具身智能与机器人学习

强化学习与模型后训练

规划、推理与决策算法

3、对 Agent 的任务规划、工具使用、记忆机制、上下文学习、反思纠错或自主决策等方向有深入理解,能够将算法问题转化为可验证的技术方案。

4、熟练使用 Python,熟悉 PyTorch 等深度学习框架,具备独立开展数据处理、模型训练、实验分析和算法评测的能力。

5、具备良好的沟通与协作能力,能够与机器人、感知、平台及产品团队共同推动算法落地。

加分项:

1、具备 Agentic RL、RLHF、RLAIF、PPO、GRPO 或其他策略优化方法的研究与实践经验。

2、有大模型 SFT、偏好优化、奖励模型或模型后训练经验。

3、有真实机器人上的 Agent、强化学习或多模态交互算法落地经验。

4、熟悉 VLM、VLA、世界模型、模仿学习或机器人策略学习。

5、有仿真环境、交互式训练环境或大规模行为轨迹数据建设经验。

6、在相关领域发表过高质量论文,或有具备影响力的开源项目、竞赛及产品成果。

7、对前沿 Agent 研究保持持续关注,并具备较强的算法复现与创新能力。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →