岗位描述
岗位职责:
承担教育场景下的实时语音理解,结合降噪技术及富语言信息解析,优化长上下文、多说话人、多语种、及多轮连续对话场景的识别率,提升语音内容识别质量。
开发与优化低延迟语音处理方案,持续调优首包、尾包及整体响应时延,提升系统的实时性与用户体验。
负责语音交互中的判停、拒识及音频属性理解算法的研发工作,完善语音系统对复杂场景的适应能力。
实现语音打断机制,包括 TTS 播报中断、LLM 生成取消及上下文状态同步,确保多轮交互的流畅性。
参与实时语音对话系统的端到端技术架构设计与模块开发,协助优化系统方案并推动技术落地。
跟踪行业前沿的语音识别与对话技术,探索创新解决方案,并推动适应实际业务场景。
任职要求:
学历要求:硕士及以上学历,计算机科学、信号处理、电子信息、模式识别相关专业优先。
在语音识别(ASR)方向有1-3年的工作经验,有工业级 ASR 系统上线经验。
熟悉语音大模型,并能进行复杂场景的优化。
熟悉 ASR、VAD、LLM、TTS 等模块之间的协同工作关系,能够优化系统整体工作链路。
具备语音打断(Barge-in)、尾点检测及低延迟优化的经验,能够满足高实时性的技术需求。
熟练掌握 Python/C++ 等编程语言,熟悉 PyTorch 等深度学习框架,具有语音模型训练和优化的实施经验。
加分项:
具备端到端语音大模型(Speech + Text 联合训练)的训练与调优经验;
有语音技术相关论文在 Interspeech、ICASSP 等顶级学术会议发表;
具备优秀的问题解决能力与团队协作精神,能积极应对技术挑战并推动任务目标的顺利实现。