岗位描述
工作职责:
1. 大模型监督微调与迭代
基于业务真实数据与线上反馈,设计、实现 LLM / 多模态模型 SFT 微调方案;面向分类、信息抽取、内容理解、开放式生成等任务,持续提升模型效果与泛化能力。
2. 强化学习对齐算法落地
参与强化学习后训练全流程,包括 GRPO、DAPO、GSPO 等算法实践;根据业务场景设计偏好数据、打分器 / 奖励函数,优化采样策略、优势估计、KL 约束,提升模型对齐效果与训练稳定性。
3. Agent 应用
搭建Agent能力解决复杂内容理解任务,在内容理解平台上实现工具调用、多轮反思,赋能智能标注等,支持产品/运营完成内容理解效果调研。
4. 训推工程和部署上线
基于 LLaMA-Factory、EasyR1、Verl等训练框架完成数据流水线、训练配置、实验管理与复现。
与数据、产品、工程团队协作,建立“数据—训练—评估—上线—反馈”的闭环体系。
工作要求:
1.2027届本科及以上学历,具备扎实的机器学习、深度学习和编程基础。
2.是 AI 的深度使用者,能够将大模型融入日常学习和研发工作。
3.能够结合 Prompt、Agent、RAG、代码生成等能力解决实际问题,并验证结果的正确性。
4.对 AI 前沿技术保持敏感,能够快速理解、动手验证并形成自己的判断。
5.不满足于复现现有方案,愿意主动发现问题并持续推进。
6.有推荐、NLP、多模态、大模型、科研竞赛或高质量项目经验者优先。
7.相比掌握多少技术名词,我们更关注你能否驾驭 AI、保持独立判断,并把技术转化为高价值结果。
8.熟练使用AI agent能力者优先。