岗位描述
岗位描述
1. 设计并研发高性能的音频Encoder架构,提取高质量的音频时频特征或语义表征,支持下游任务(如语音识别、音频生成、音乐信息检索等)。
2. 构建并优化基于VAE的音频生成/重建模型,研究隐空间(Latent Space)的结构化设计,提升生成音频的质量、多样性与可控性。
3. 前沿技术追踪:跟进前沿音频生成与表征学习技术,进行复现、改进与工程化落地。
4. 数据与评估:参与音频数据集的构建与清洗,设计并优化客观与主观评估体系。
岗位要求
1. 计算机、电子工程、信号处理、数学或相关专业本科及以上学历,硕士/博士优先。
2. 精通Python,熟练使用PyTorch或JAX进行深度学习模型开发,具备良好的工程代码规范与Git协作习惯。
3. 熟悉主流音频Encoder架构。
4. 有音频表征学习相关项目经验,有顶会论文(ICASSP, Interspeech, NeurIPS, ICLR等)或开源项目贡献者优先。