锦鲤求职

商汤科技

下一代多模态大模型架构研究实习生|Loop Transformer 方向

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
参与下一代多模态大模型架构研究,重点探索 Loop Transformer 等新型计算架构,并在 图像生成、视频生成及统一多模态模型 上进行大规模验证。
你将围绕循环计算、参数共享、有效计算深度、动态计算量分配和 Scaling 等核心问题开展研究,探索如何在可控参数规模下提升模型的计算能力、生成质量和扩展效率。
研究对象包括独立的 Image Generation、Video Generation 模型,以及支持理解、生成和编辑等能力的 Unified Multimodal Model。
工作职责
1、参与 Loop Transformer 核心架构研究,探索参数共享、循环计算、状态迭代和动态深度等模型设计。
2、研究 参数规模、模型深度、Loop 次数与计算量 之间的关系,探索区别于传统参数 Scaling 的新型 Compute Scaling 路径。
3、研究 Loop Transformer 的训练与优化机制,分析不同循环阶段的 Representation、Activation 和 Gradient 演化,解决训练稳定性和能力退化等问题。
4、将新型架构应用于 图像生成和视频生成模型,结合 Diffusion Transformer、Flow Matching、Autoregressive Generation 等范式进行验证。
5、探索 Loop Transformer 在 统一多模态模型 中的应用,研究不同模态和任务之间的参数共享、计算共享与统一 Backbone 设计。
6、开展系统性的 Architecture Ablation 和 Scaling Experiment,研究模型深度、宽度、Loop 设计、Token 数量和计算预算等因素对模型能力的影响。
7、跟踪并推进 Loop Transformer、生成模型架构和多模态基础模型方向的前沿研究,完成算法设计、实验验证、效果分析和大规模训练迭代。

岗位要求
1、计算机、人工智能、数学、电子信息等相关专业在读硕士、博士或优秀本科生。
2、熟悉 Python 和 PyTorch,具备扎实的模型实现、训练调试和实验分析能力。
3、对 Transformer 架构 有深入理解,熟悉 Attention、FFN、Normalization、Residual Connection 等核心组件。
4、熟悉至少一种现代生成模型范式,包括 Diffusion Transformer、Flow Matching 或 Autoregressive Generation,对图像生成、视频生成或多模态模型有实际理解。
5、具备模型架构、图像生成、视频生成或多模态模型相关研究项目经验,或至少有 1 篇 CVPR、ICCV、ECCV、NeurIPS、ICML、ICLR 等顶会论文。
加分项
有 Loop Transformer、Recurrent Transformer、Parameter Sharing、Iterative Computation 等相关研究经验。
有大规模 图像生成、视频生成或多模态模型 训练经验。
有 Transformer Architecture、Scaling Law、Training Dynamics 或模型内部机制分析相关研究经验。
熟悉 Megatron-LM、DeepSpeed、FSDP、Transformer Engine 等大规模训练框架及并行训练技术。
在生成模型、计算机视觉、多模态学习或模型架构方向有高质量论文或有影响力的开源项目。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →