岗位描述
岗位职责:
1、跟进大语言模型、多模态大模型领域前沿技术,参与预训练框架优化、模型结构创新、对齐技术升级等方向的技术攻关与研究;
2、负责大模型全链路算法研发,包括预训练、有监督微调(SFT)、知识蒸馏、RLHF/RLAIF等环节的实验设计、迭代调优;
3、围绕业务场景需求开展模型适配优化,通过小样本训练/微调、领域蒸馏、量化压缩等方式提升模型在垂直场景的效果,降低推理部署成本;
4、参与模型训练数据集的清洗标注、构建优化,以及模型效果评估体系的搭建,保障模型训练的效率、稳定性与落地效果;
5、沉淀算法研究成果,输出技术专利、学术论文、技术文档,配合工程团队完成算法能力的落地交付。
任职资格:
1、计算机科学、人工智能、数学、大数据等相关专业学历专业,硕士及以上学历,有大模型相关方向科研、实习经历者优先;
2、扎实掌握深度学习、自然语言处理/多模态学习基础理论,熟悉Transformer系列模型结构,熟练使用PyTorch/TensorFlow等主流深度学习框架;
3、具备大模型相关实践经验,有预训练、微调、知识蒸馏、模型压缩任意方向的项目/竞赛/科研经历者优先;
4、优秀的数理基础与代码实现能力,能够独立完成算法实验设计、迭代与结果分析,具备良好的英文文献阅读能力;
5、对大模型前沿技术有强烈的探索热情,学习能力强,具备良好的团队协作意识与问题解决能力。