岗位描述
岗位职责
1、参与商汤新一代通用基模型的后训练研发,覆盖语言、长程智能体、多模态理解与生成、代码、数学推理、复杂指令遵循等核心能力建设;
2、围绕 SFT、偏好学习、Reward Model、Verifier、RLHF、DPO、PPO、GRPO/RFT、Agentic RL 等方向,研究并落地前沿后训练算法,提升模型推理、规划、工具调用、自我验证和长任务执行能力;
3、建设高质量后训练数据体系,包括指令数据、推理数据、代码数据、工具调用轨迹、Agent 环境交互数据、偏好数据、多模态对齐数据等,形成数据生产、筛选、配比、评测和迭代闭环;
4、参与模型能力评测与 Badcase 分析,构建面向通用能力、推理能力、代码能力、Agent 能力、安全对齐和多模态能力的评测体系,驱动数据和算法持续优化;
5、跟踪国内外通用大模型和一体化多模态基模型前沿进展,探索可规模化的训练信号、自动化数据合成、长上下文强化学习、工具增强学习和模型自进化机制;
6、与预训练、推理系统、产品和行业应用团队协作,推动基模型能力在真实场景中落地,形成从基础能力研究到产品效果提升的完整闭环。
岗位要求
1、2027届本科及以上学历,计算机、软件工程、人工智能等相关专业 ;
2、对通用人工智能和基础模型长期发展有强烈兴趣,具备优秀的学习能力、工程意识、团队协作能力和结果导向;
3、 具备较强的 AI-Native 研发工具链使用和实验能力。具备良好的论文阅读、问题抽象和实验分析能力,能够将前沿研究转化为可验证的算法方案和工程实现;
4、具备扎实的计算机基础、工程实现能力和大模型相关技术基础,熟悉 Transformer、Attention、MoE、RL、长上下文、工具调用、函数调用、RAG、Agent、多智能体协作等基础方法者优先;
5、熟悉大语言模型或多模态大模型研发流程中的至少一个环节:模型评测、数据构建、后训练、对齐、推理优化、Agent Harness、任务环境构建、工具接入、轨迹采集、自动打分、失败分析与数据闭环等;
6、 有以下经验者优先:Agent 框架研发、代码智能体、浏览器/桌面自动化、工具调用系统、沙箱执行环境、长程任务评测、多智能体协作、Deep Research、AI Coding、RAG+Agent、强化学习环境构建、大模型训练/微调、模型评测或多模态理解与生成。在 NeurIPS、ICML、ICLR、ACL、EMNLP、CVPR、ICCV、ECCV、AAAI、KDD、MM 等顶会发表论文,或在高水平竞赛、开源社区、模型榜单、Agent/代码/评测相关项目中有突出成果者优先。