岗位描述
岗位职责
职位概述
参与大模型 Agent 和多模态模型自我进化算法研究,重点围绕模型权重更新、后训练数据构建、Verifier 设计和递归评测闭环展开工作。你将参与研究如何让模型自主发现能力缺陷、生成训练任务和反馈信号,并通过 SFT、强化学习或其他后训练方法提升下一代模型的能力。研究对象包括文本、图像、音频、视频等多模态模型及其 Agent 系统。
工作职责
1、参与多模态大模型 Agent 的递归自我改进算法研究,设计模型自主发现问题、生成任务、构造反馈并更新模型的闭环流程。
2、探索模型导向的 RSI 方法,包括自博弈、Challenger–Solver、Verifier / Judge 共进化、自动课程学习、在线后训练和模型权重持续更新。
3、参与多模态后训练数据构建,包括任务数据、Agent 轨迹、偏好数据、难例数据、负样本和多轮交互数据的自动生成、筛选与质量控制。
4、研究适用于开放式多模态任务的 Verifier、Reward Model、Rubric 和自动评测方法,提升反馈信号的准确性、稳定性和可扩展性。
5、设计 RSI 评测体系,分析模型在多轮自我改进中的能力变化,包括任务性能、泛化能力、能力保持、训练稳定性、任务顺序敏感性和随机种子方差等。
6、跟踪并复现 RSI、AutoResearch、AI4AI、LLM Agent 和多模态模型后训练方向的前沿工作,完成算法实现、实验设计、效果分析和方案迭代。
7、与多模态预训练、后训练、Agent 系统和评测团队合作,推动研究成果在真实任务和业务场景中的验证。
岗位要求
1、计算机、人工智能、数学、电子信息等相关专业在读硕士、博士或优秀本科生。
2、熟悉 Python 和 PyTorch,具备较强的算法实现、数据处理和实验分析能力。
3、了解大语言模型或多模态模型的训练、推理和后训练流程,接触过 SFT、RL、DPO、GRPO、Reward Model 等方法。
4、对 Agent、强化学习、自动化数据构建、模型评测或持续学习方向有兴趣。
5、具备较强的问题分析和独立研究能力,能够从实验现象中定位问题并提出改进方案。
6、能够阅读和理解英文论文、技术报告和开源代码,并完成相关工作的复现与改进。
7、对 Recursive Self-Improvement、AutoResearch 或“AI 改进 AI”方向感兴趣;不要求已有 RSI 项目经验,但需要具备较强的学习能力和研究热情。
加分项
有大模型、多模态模型、Agent 或强化学习相关项目经验。
有视觉语言模型、语音/音频模型、视频理解或多模态交互模型研究经验。
熟悉 verl、TRL、Megatron-LM、DeepSpeed 等训练框架,或有分布式训练经验。
有 Reward Model、Verifier、LLM-as-a-Judge、自动评测或偏好数据构建经验。
参与过 AI Scientist、AutoResearch 等自进化或自动化研究工作的复现。
有机器学习、自然语言处理、计算机视觉、强化学习等方向的论文、竞赛或开源项目成果。
有较好的科研写作能力,具备论文、专利或技术报告产出经验。