岗位描述
岗位职责
1、参与多模态语音交互场景下的语音理解、语音生成和语音交互大模型的算法研发、性能优化与落地实现;
2、 参与数字人场景下的个性化实时情感对话语音合成、篇章语音合成、低资源音色克隆、语音识别、语种识别、声纹识别、变声、音乐生成等技术研发;
3、跟进学术界、行业最新的研究趋势,产出新的科研成果,并落地于实际产品。
岗位要求
1、2027届本科及以上学历,计算机、软件工程、人工智能等相关专业;
2、 熟悉ASR/TTS、端到端语音建模(如Conformer-Transducer、Whisper)
3、精Transformer/RNN-T,有语音大模型(VALL-E、MMS)或NLP大模型经验
4、掌握PyTorch/TensorFlow,熟悉模型优化(量化、蒸馏)及部署(ONNX/TensorRT)
加分项
• 参与过语音大模型训练或优化(千小时级数据)
• 有低资源语音、多语种适配或实时交互优化经验
• 硕士及以上,计算机/AI相关专业,顶会论文(Interspeech、ICASSP等)加分