锦鲤求职

阿里巴巴

研究型实习生-端到端的语音双工对话大模型研究

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位描述
全双工语音交互被视为语音对话系统的终极形态,也是人机交互体验实现质变的关键方向。然而,当前主流语音助手仍普遍采用半双工或伪双工架构,"用户说完→系统处理→系统回复"的串行流程使得交互体验与自然人机对话之间存在显著差距。同时,级联式的 ASR-LLM-TTS 架构还面临延迟累积、误差传递、表现力与实时性难以兼顾等一系列挑战。
本课题聚焦端到端架构下的全双工语音对话大模型研究,致力于打破"先听后说"的串行范式,探索理解与生成在统一隐空间中的联合建模路径,构建真正具备双向流式交互能力、高自然度与高表现力的下一代语音对话系统,并在车载、智能硬件、智能客服、情感陪伴等场景形成显著的体验优势。

具体研究方向包括:
1、双向流式端到端双工建模,探索单一模型同时处理输入音频流与输出生成的架构,攻克 turn-taking 决策、打断检测与流式解码的协同优化难题;
2、高表现力端到端对话模型,研究情感、风格、语速等细粒度控制与实时生成的平衡方案,打造多说话人、多风格、多语言的统一生成模型;
3、理解生成统一建模,探索从原始音频到原始音频的端到端映射,摒弃传统文本中间表示,捕捉并复现副语言信息,实现真正的"语音思维"。

岗位要求
1、计算机/人工智能/认知科学等相关专业在读硕士/博士;
2、有扎实的理论基础,对大模型、多模态建模、强化学习等相关技术研究感兴趣;
3、加分项:在ACL/NeurIPS/CVPR等顶会发表过人机交互或多模态相关论文 或 有实际的多模态对话系统、智能体交互或具身智能项目开发经验。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →