岗位描述
岗位职责
1、负责云端大模型对齐与后训练(Post-training)核心算法的研发、优化与前沿技术探索;
2、深入研究并落地 SFT(监督微调)、Agentic RL(智能体强化学习)、DPO/PPO/OPD 等模型微调与强化学习技术;
3、针对复杂业务场景或智能体(Agent)交互场景,设计合理的模型奖励机制与数据飞轮,持续提升云端大模型的推理能力与对齐效果;
4、跟进业界最新前沿进展(如各类 Alignment 技术),并能敏捷地将优质文献中的算法在业务中复现并落地。
岗位要求
1、本科及以上在读,计算机、数学、人工智能相关专业,至少实习3个月,每周出勤5天;
2、具备扎实的编程基础,熟练掌握 Python、PyTorch 深度学习生态。熟悉 verl、DeepSpeed、Megatron 等分布式训练,强化学习框架者优先;
3、具备优秀的数学功底与机器学习理论基础,对深度学习底层逻辑有深刻理解;
4、具备大模型后训练实战经验,深度参与过 SFT、RM、RLHF、DPO、PPO 等核心环节中的一个或多个;
5、加分项: 在人工智能顶会(如 ACL, EMNLP, ICLR, NeurIPS 等)有相关论文发表经验,或具备优秀的学术论文撰写与科研能力。