岗位描述
岗位职责
关于岗位
模型能力变强,并不自动意味着它更值得信任:它可能在缺乏证据时自信作答,在复杂约束下遗漏指令,在偏好优化中学会迎合,或在长程任务中偏离目标。如何通过后训练,让模型既有能力解决问题,也能稳定地做出正确的行为选择?
你将围绕幻觉、复杂指令遵循、偏好对齐与 Agent 协作开展算法研究,探索如何将证据、偏好和交互反馈转化为有效的学习信号。这里的 Alignment 不止于调整回答风格,而是通过数据、奖励与训练方法,塑造模型在复杂交互中的判断和行动能力。你可以根据专长深入其中一个或多个方向,并参与从问题定义到训练验证的完整过程。
你将探索的技术问题
让模型知道何时继续验证、何时停止作答: 如何把证据充分性与不确定性转化为训练信号,减少幻觉,而不是让模型一味拒答?
让偏好优化学到真实目标: 如何避免奖励投机、谄媚和表面风格拟合,在有用性、诚实性与用户自主权之间形成稳定的行为策略?
让 Agent 在长程交互中可靠学习: 如何设计过程奖励与轨迹数据,将澄清、纠错、授权判断和结果验证纳入优化目标?
工作职责
研究幻觉抑制与不确定性建模。 围绕无依据生成、证据冲突和过度自信等问题,研究证据约束训练、置信度校准、自适应搜索与验证策略;构建可验证任务及奖励信号,优化模型何时检索、何时复核、何时表达不确定性,在减少幻觉的同时保持回答的有效性。
增强复杂指令遵循与约束泛化。 面向多约束组合、指令优先级、格式控制、长上下文及多轮约束更新,研究任务合成、难例挖掘、课程学习与约束验证方法,通过 SFT 和强化学习等技术提升模型对未见指令组合的泛化与稳定执行能力。
研究偏好对齐与奖励建模。 将 Model Spec、用户偏好与专家判断转化为可学习的监督和奖励信号,开展偏好数据构建、奖励模型训练、DPO 等偏好优化及 RL 方法研究;分析奖励投机、谄媚、过度拒答与能力回退,探索多目标偏好之间的权衡和泛化。
研究 Agent 协作行为与长程策略学习。 围绕主动澄清、反馈吸收、授权边界、目标保持、失败恢复和交付验证,构建多轮交互任务与训练轨迹;探索过程奖励、长程信用分配及交互式训练方法,提高复杂任务的可靠完成能力,减少目标偏移与虚假完成。
构建数据、训练与评测闭环。 从真实问题中提炼可验证的算法假设,开展数据合成与筛选、训练配比设计、对照和消融实验;结合独立评测、分场景诊断及回归验证,评估训练收益、泛化效果和能力间的相互影响。
提升模型基础体验。 将上述研究应用于 Chat、Search 与 Agent 场景,优化回答有用性、表达自然度、详略控制和多轮稳定性,改善重复、语言混杂及不合理拒答等问题,让技术进步转化为可感知的用户体验。
岗位要求
任职要求
具备扎实的机器学习与深度学习基础,理解大语言模型训练和推理机制,有模型训练、后训练或相关算法研究经验。
熟练使用 Python 和 PyTorch 等深度学习框架,能够独立完成数据处理、训练实现、实验设计及效果诊断。
对 SFT、DPO 等偏好优化、奖励建模或强化学习中的至少一个方向有深入理解与实践,能够分析训练目标、数据分布和优化过程对模型行为的影响。
在幻觉、指令遵循、偏好对齐、搜索增强或 Agent 学习中的至少一个方向有积累,能将开放的行为问题转化为任务、学习信号与可检验的研究假设。
具备严谨的实验与分析能力,能够通过消融、独立测试及分场景评估识别真实收益,关注泛化、奖励投机与能力回退,而非只优化单一指标。
具备良好的研究主动性与跨专业协作能力,愿意深入分析模型轨迹,与人文训练师、评测和工程团队共同推进算法迭代。
加分项
有偏好优化、奖励模型、在线 RL 或多目标对齐研究经验,能深入分析偏好噪声、分布偏移和奖励泛化问题。
有幻觉抑制、置信度校准、搜索与验证策略学习,或复杂指令数据合成与约束验证经验。
有多轮工具调用、Agent 轨迹训练、过程奖励、长程信用分配或交互环境中的强化学习经验。
有相关论文、开源实现,或从问题发现、数据构建到训练评测的完整实践成果。