锦鲤求职

阿里巴巴

研究型实习生 - 全模态基座基础能力与Agentic应用

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
千问(Qwen)是由阿里巴巴自主研发的超大规模语言模型,具备跨语言、跨任务的理解与生成能力。Qwen系列模型,涵盖参数量从几百 M 到 T 级的基座大语言模型,并相继推出Qwen-VL、Qwen-Audio、Qwen-Omni、Qwen-Coder等系列模型。从多轮对话到代码生成,从逻辑推理到内容创作,从单一多模态到全模态统一理解生成,Qwen 正在打造全球领先的全模态模型技术体系,推动AI在企业服务、开发者生态、个人用户等领域的深度应用,引领下一代人工智能的发展。

团队致力于追逐实现 Omni 基座模型,实现全模态理解与对话统一。团队音频组负责围绕 Qwen 基座模型展开音视频/音频处理以及与音视频交互相关的基础研究及其应用,代表工作有 Qwen-Omni系列, Qwen-LiveTranslate系列等。

工作职责:
1. 音频/音视频 Agentic能力: 原生音视频Agentic/Long-horizen, 全模态Agentic/Coding不降智等。
2. 音视频理解基础能力:包括Caption, Grouding, 音视频Alignment, General QA,长视频,多音视频理解等。
3. 音频/语音理解基础能力: 包括ASR, MultiSpkASR, 语音/音频Grouding/Counting/QA,音乐理解,长音频,多音频理解等。
4. 音频/音视频Postrain/RL/OPD。
5. 音视频通话与交互:包括全音视频双工, 音频query不降智/体感优化等。
6. 语音生成基础能力: 包括音色克隆,可控性,长语音生成稳定性等。
7. 全模态模型自主优化与Self-evolving。

岗位要求
1. 候选人应为计算机及相关专业的博士或硕士研究生,且对音视频领域有充分的兴趣。
2. 具备音频/语音理解与生成、多模态对齐与交互(音视频Alignment/Captioning)、或 Agentic AI 与长程推理(Long-horizon/Omni模型)任一方向的深入项目经验。
3. 在 ACL, ICML, NeurIPS, CVPR, Interspeech 等顶级会议/期刊发表论文,或在相关开源项目、技术竞赛中有突出表现者优先。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →