锦鲤求职

世纪华通

大模型后训练算法实习生(可转正)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

工作地点:上海

招聘类型:可转正实习

实习周期:长期

【项目介绍】

我们正在建设一套面向卡牌策略对抗场景的 AI 对战系统。项目涉及不完全信息推理、长序列决策、多角色协作与对抗、策略泛化等问题。

你将与项目负责人及算法团队共同参与模型训练、数据构建和评测体系建设,推动大模型从“能够理解局面”进一步发展为“能够稳定做出高质量策略决策”。

【岗位职责】

参与策略决策模型的后训练和效果优化,包括 SFT、偏好优化、强化学习等方向;

基于脱敏交互日志、专家策略和模拟对局,构建状态—动作数据、偏好数据及训练样本;

参与训练数据的清洗、筛选、难例挖掘、质量评估和数据配比实验;

设计或优化奖励信号,提升模型在局面判断、长期规划、风险控制和协作对抗等方面的能力;

参与 Self-play、离线回放和批量对抗实验,分析模型失败案例并持续迭代;

参与模型评测体系建设,关注胜率、决策合法率、策略稳定性、泛化能力和策略多样性等指标;

与 Agent、服务端及测试团队协作,推动模型能力接入完整的 AI 对战链路。

【任职要求】

计算机、人工智能、自动化、数学等相关专业在校生;

熟悉 Python,能够使用 PyTorch 等深度学习框架完成训练和实验;

实际参与过至少一个大模型训练或后训练项目,了解 SFT、DPO、PPO、GRPO 等一种或多种方法;

能够清晰说明项目中的数据来源、训练目标、实验设计、评测方法以及本人承担的工作;

对强化学习、序列决策或策略学习有基本理解;

具备良好的实验习惯,能够进行指标分析、失败案例归因和训练结果复现;

对复杂策略问题有兴趣,具备较强的学习能力和问题拆解能力。

【加分项】

有 Self-play、强化学习或多智能体训练经验;

有卡牌、棋类、博弈或其他游戏 AI 项目经验;

做过奖励模型、过程奖励、偏好数据构建或合成数据生成;

熟悉分布式训练、推理加速或训练框架;

有论文复现、算法竞赛、开源项目或技术博客等可展示成果;

对不完全信息博弈、对手建模或策略搜索有一定理解。

【你将获得】

参与真实策略对抗 AI 系统从训练到落地的完整过程;

接触数据构建、后训练、Self-play 和评测闭环,而不只是单一模型调参;

与项目负责人直接协作,对技术方案和模型迭代产生实际影响;

获得可量化、可复盘的模型训练和策略优化经验。

【投递建议】

请在简历中重点说明相关项目的:

项目目标、模型规模、训练方法、数据规模、评测指标、最终效果以及本人具体贡献。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →