岗位描述
岗位职责
1. 围绕 SpeechLLM 语音大模型开展前沿研究,探索语音与文本统一建模、端到端语音交互及模型后训练,提升语音理解与生成能力。
2. 研究 Voice Agent 技术,优化流式交互、全双工对话、用户打断及轮次判断,提升复杂声学环境下的交互自然度与响应速度。
3. 面向语音助手场景,研究音色定制、韵律控制和情感表达,实现自然、稳定、具有个性化音色的语音答复。
4. 面向同声传译场景,研究流式语音翻译、多语言语音生成及跨语言音色保持,兼顾翻译准确性、自然度与低时延。
5. 建立语音模型与交互系统的评测体系,推进模型压缩、推理优化及端侧部署,推动前沿技术在实际产品中落地。
岗位要求
1. 语音信号处理、人工智能、计算机、电子信息等相关方向的应届博士毕业生,具备扎实的机器学习、深度学习及语音处理理论基础。
2. 在语音识别、语音合成、语音翻译、语音语言模型等一个或多个方向有深入研究,具备独立开展科研、设计实验和分析问题的能力。
3. 熟练掌握 Python、PyTorch 等开发工具,具备语音数据处理、模型训练、微调与评测经验。
4. 具备良好的工程实践与沟通协作能力,能够结合真实场景中的噪声、时延、算力等约束,推动算法优化与产品落地。
5. 有 SpeechLLM、实时 Voice Agent、音色定制或同声传译相关经验者优先;在 Interspeech、ICASSP、ASRU、SLT、ACL、NeurIPS、ICML、ICLR 等会议发表相关成果,或有高质量开源贡献者优先。