锦鲤求职

京东

基于电商大模型的Mid-train及RL研究

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1. 设计并实现电商场景下的大模型中期训练(Mid-train)算法,解决领域知识注入与能力对齐等核心难题;
2. 负责电商场景下Agentic大模型的强化学习后训练,攻坚奖励模型(RM)、策略优化(如PPO、GRPO)及多轮交互决策优化等关键技术;
3. 构建面向电商业务的高质量训练数据、奖励数据及评测基准(Benchmark),通过数据闭环迭代驱动模型性能优化;
4. 推动大模型研究成果在智能推荐、智能导购及智能运营等真实业务场景中的端到端落地,解决实际业务痛点。

任职要求
1. 计算机、人工智能或相关专业博士 / 硕士,有扎实的机器学习、强化学习理论基础。
2. 熟悉大语言模型(LLM)训练与后训练流程,有 SFT/RLHF/RLOO/GRPO 等相关项目经验。
3. 有 Agent 训练、Tool-use、多步推理等相关研究或工程落地经验者优先。
4. 熟悉 PyTorch,有大规模分布式训练(如 DeepSpeed、Megatron-LM)经验者优先。
5. 有顶会论文(ICML/NeurIPs/ICLR 等)或开源项目贡献者优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →