岗位描述
职位概述
负责业务模型后训练的具体落地与迭代,参与 SFT、RLHF/DPO 偏好对齐、Agent 能力训练等环节,配合团队完成从数据生产、模型训练、评测到上线的全流程工作。
核心职责
后训练流程落地
参与 SFT、DPO、PPO、Reward Modeling 等后训练 Pipeline 的开发与落地,负责训练、调参、评测到上线回归的具体执行
在 Agent 与 Tool-use 方向参与训练优化,提升工具调用准确率、多轮指令遵循、幻觉控制等指标
参与核心场景模型迭代,如 Router、Query 改写、Agent 工具调用、Web Search 决策、Memory、电商搜索相关性等
数据与评测
负责后训练数据的采集、清洗、合成与标注流程,参与标注规范制定与外包对接
搭建并维护人工 + LLM-as-Judge 的自动化评测,产出可复现的效果报告
跟进业界前沿方法,在团队方向下做技术复现与尝试
任职要求
必须具备
计算机、AI 或相关专业本科及以上学历
有 LLM 后训练(SFT、DPO、PPO、RLHF、Reward Modeling 等)中至少一项的实践经验,能独立完成从数据到训练、评测的关键环节
熟悉至少一种主流训练框架 (如 Megatron、veRL 等),了解分布式训练的基本原理
对 Agent / Tool-use / 多轮对话有了解,熟悉 Function Calling 的数据构造与基本对齐思路
良好的工程能力和问题排查能力,能在效果与迭代效率之间做合理权衡
加分项
有完整的后训练端到端落地经验,或参与过千卡级分布式训练
有领先大模型团队(Qwen、DeepSeek、Kimi、Minmax等) 的相关经验
对 Agent RL、Self-play、合成数据、推理时计算等方向有了解或实践