岗位描述
工作地点:上海
招聘类型:可转正实习
实习周期:长期
【项目介绍】
我们正在建设一套面向卡牌策略对抗场景的 AI 对战系统。项目涉及不完全信息推理、长序列决策、多角色协作与对抗、策略泛化等问题。
你将与项目负责人及算法团队共同参与模型训练、数据构建和评测体系建设,推动大模型从“能够理解局面”进一步发展为“能够稳定做出高质量策略决策”。
【岗位职责】
参与策略决策模型的后训练和效果优化,包括 SFT、偏好优化、强化学习等方向;
基于脱敏交互日志、专家策略和模拟对局,构建状态—动作数据、偏好数据及训练样本;
参与训练数据的清洗、筛选、难例挖掘、质量评估和数据配比实验;
设计或优化奖励信号,提升模型在局面判断、长期规划、风险控制和协作对抗等方面的能力;
参与 Self-play、离线回放和批量对抗实验,分析模型失败案例并持续迭代;
参与模型评测体系建设,关注胜率、决策合法率、策略稳定性、泛化能力和策略多样性等指标;
与 Agent、服务端及测试团队协作,推动模型能力接入完整的 AI 对战链路。
【任职要求】
计算机、人工智能、自动化、数学等相关专业在校生;
熟悉 Python,能够使用 PyTorch 等深度学习框架完成训练和实验;
实际参与过至少一个大模型训练或后训练项目,了解 SFT、DPO、PPO、GRPO 等一种或多种方法;
能够清晰说明项目中的数据来源、训练目标、实验设计、评测方法以及本人承担的工作;
对强化学习、序列决策或策略学习有基本理解;
具备良好的实验习惯,能够进行指标分析、失败案例归因和训练结果复现;
对复杂策略问题有兴趣,具备较强的学习能力和问题拆解能力。
【加分项】
有 Self-play、强化学习或多智能体训练经验;
有卡牌、棋类、博弈或其他游戏 AI 项目经验;
做过奖励模型、过程奖励、偏好数据构建或合成数据生成;
熟悉分布式训练、推理加速或训练框架;
有论文复现、算法竞赛、开源项目或技术博客等可展示成果;
对不完全信息博弈、对手建模或策略搜索有一定理解。
【你将获得】
参与真实策略对抗 AI 系统从训练到落地的完整过程;
接触数据构建、后训练、Self-play 和评测闭环,而不只是单一模型调参;
与项目负责人直接协作,对技术方案和模型迭代产生实际影响;
获得可量化、可复盘的模型训练和策略优化经验。
【投递建议】
请在简历中重点说明相关项目的:
项目目标、模型规模、训练方法、数据规模、评测指标、最终效果以及本人具体贡献。