锦鲤求职

阿里巴巴

日常实习生-后训练合版/OPD方向-Qwen基础模型

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
1. 合版算法研究:探究以 SFT 和 On-Policy Distillation(OPD)为核心的合版策略,持续优化合版训练效果,改善专项冲突问题,提升合版流程的稳定性与合版结果的可预测性。
2. 合版反馈链路建设:分析合版训练监控指标,定位冲突专项与原因,为专项模型的数据迭代和 SFT、RL 训练流程提供反馈,帮助专项在改进性能的同时减小合版冲突风险。
3. 合版训练框架建设:参与 OPD 等合版训练框架的迭代,与 infra 和工程团队协作,探究、开发面向多专项、超长程任务的合版算法与框架,提升合版训练框架的效率与稳定性。
4. 合版前沿技术追踪:持续追踪前沿的合版技术,在内部模型研发中快速测试与验证。

岗位要求
1. 计算机科学、机器学习、人工智能相关专业背景,硕士及以上学历优先。
2. 熟悉 LLM 后训练、合版、OPD/RL 训练流程与算法,有大规模模型交付和迭代流程经验的优先。
3. 具备优秀的工程能力,熟悉 Megatron、FSDP 等训练框架和 SGLang、vLLM 等推理框架,熟悉 veRL、slime 等 RL 训练框架,有 100B 以上 MoE 模型及千卡训练经历的优先。
4. 在 NeurIPS、ICLR、ACL 等国际顶级会议/期刊上发表过高影响力论文,或具有知名开源项目贡献经历。
5. 有基模团队工作/实习经历的优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →