岗位描述
岗位职责
1.负责语音合成/TTS核心算法研发与优化,包括声学模型、声码器、端到端 TTS、SpeechLM 等方向,持续提升合成语音的自然度、表现力和稳定性。
2.面向业务场景,落地多语种/方言、情感合成、个性化音色、音色克隆、实时交互等语音合成能力。
3.负责语音合成前端与数据 Pipeline 建设,包括文本处理、韵律建模、音频处理、数据清洗、模型训练、评测与迭代。
4.跟踪语音合成前沿技术,如 LLM/多模态在 TTS 中的应用、零/少样本音色克隆、Instruct TTS 等,并推动产品化落地。
岗位要求
1.计算机、人工智能、信号处理、通信、自动化等相关专业硕士及以上学历,3 年及以上语音合成相关经验优先。
2.熟悉语音合成核心技术,掌握声学模型、声码器、端到端 TTS、音色克隆、声音转换等相关算法。
3.熟悉至少一种主流 TTS 模型或技术路线,如 Tacotron、FastSpeech、VITS、Diffusion TTS、Neural Vocoder、SpeechLM 等。
4.熟练使用 Python 及 PyTorch/TensorFlow,具备良好的算法实现、模型训练、调参与效果优化能力。
5.具备一定工程化能力,熟悉 Java/C/C++ 更佳;了解模型部署、推理加速、模型压缩、低延迟/流式合成等技术。
6.熟悉语音合成前端处理流程,如文本规范化、分词、拼音/音素转换、多音字处理、韵律预测等。
7.具备良好的问题分析、沟通协作和项目推进能力,能够阅读英文论文并跟进前沿技术。