岗位描述
岗位职责
1.参与语音大模型/语音智能体方向的算法研发,支持端到端语音交互能力建设,包括语音理解、对话生成、情绪感知、情感表达与语音生成等模块。
2.负责或参与低延迟、流式语音交互链路优化,提升语音输入到语音输出的实时性、自然度和稳定性,支持可打断、多轮连续对话等交互体验。
3.探索并优化 speech-to-speech / audio-to-audio / speech-native LLM 等技术方案,提升模型在语音场景下的指令遵循、上下文理解和情感共情能力。
4.结合业务场景,优化语音交互中的关键能力,如 VAD/端点检测、Streaming ASR、LLM 流式生成、Streaming TTS、语音情绪识别、情感 TTS 等。
5.建立和完善语音交互效果评测体系,包括延迟、识别准确率、回复自然度、情绪匹配度、打断成功率、无响应率及线上 badcase 分析等。
6.跟踪语音大模型、实时语音对话、多模态大模型等前沿技术,并推动合适方案在业务场景中落地。
岗位要求
1.计算机、人工智能、电子信息、信号处理、自动化等相关专业硕士及以上学历,具备语音、NLP 或多模态大模型相关经验。
2.熟悉语音大模型或语音交互相关技术,具备 ASR、TTS、Voice Conversion、Speech Emotion Recognition、SpeechLM、AudioLM、Omni Model 等方向之一的研究或项目经验。
3.熟悉大语言模型基本原理和训练/微调流程,了解 Transformer、SFT、LoRA、指令微调、多模态对齐等相关技术。
4.掌握强化学习或偏好优化相关方法,了解 RLHF、RLAIF、PPO、DPO、GRPO、Reward Model 等技术,并能结合具体任务进行模型优化。
5.具备较强的 Python 编程能力,熟练使用 PyTorch 等深度学习框架,能够独立完成模型训练、调试、评估和效果优化。
6.理解实时语音对话链路,了解 VAD、ASR、LLM、TTS、音频播放等模块之间的协同关系,有低延迟或流式处理经验优先。
7.具备良好的实验分析和问题定位能力,能够基于数据和 badcase 持续优化模型效果。
8.关注语音大模型和多模态大模型前沿进展,具备良好的学习能力、沟通协作能力和自驱力。