岗位描述
岗位职责
文本大模型团队主要负责小红书大语言模型的端到端全链路自研。主要研究方向包括:
1、持续探索大语言模型在不同阶段的高效scaling策略;
2、预训练的关键技术探索: 包括从数据策略(筛选,配比,合成,学习效率的提升)、优化技术、可解释性,到下一代模型结构的设计、long context建模、学习范式探索等;
3、通用alignment技术探索: 包括大规模RL的探索,持续提升大模型在通用能力、reasoning、长文本、agent、各方向中长尾知识等多个方向的综合能力,支撑更广泛的应用场景;
4、跟下游的多模态同学一起探索端到端全模态大模型的设计和高效scaling策略。
团队有充足的GPU计算资源,同时跟整个技术社区也有密切合作,开源开放。
岗位要求
1、本科及以上学历,计算机、数学、物理等相关专业方向优先;
2、在大规模数据处理、评测、大规模训练、结构设计、优化、对齐、RL等方向的实际经验和差异化想法者优先;
3、在ICLR/NeurIPS/ICML/TPAMI/CVPR/ICCV等顶级会议或期刊上发表有影响力的学术论文者优先;
4、有良好的沟通协作能力,责任心强,积极主动,能和团队一起探索新技术,不断推进技术进步。