锦鲤求职

小红书

音频生成式AI算法工程师-多媒体技术

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1、负责多媒体各场景音频算法处理和策略的研发,保障高质量的音频发布和消费体验;
2、负责音频生成算法的研发与业务落地:语音美化与人声增强、变声与音色转换、多模态音频生成等方向;
3、负责音频理解模型的构建与应用:音频理解基座、音频美学评价等;
4、负责基于 AI 的音频前处理算法的研究,包括但不限于 NN 语音增强、PVAD 等音频前处理算法;
5、跟踪业界前沿音频技术,包括但不限于前沿多模态模型和空间音频等方向的调研与业务落地。

岗位要求
1、硕士及以上学历,计算机、信号与信息处理或声学等相关专业,3 年及以上音频算法或深度学习相关经验;
2、精通 Python 编程,熟悉 PyTorch 等深度学习框架,具备良好的代码规范和系统设计能力;有 C/C++ 工程能力者优先;
3、熟悉以下至少一个音频相关领域:
① 扩散模型(Diffusion)、Flow Matching、Neural Codec(如 SoundStream、Encodec)等音频生成架构;
② 人声生成方向:语音合成(TTS)、语音转换(Voice Conversion)、歌声合成等生成模型;
③ 基于生成模型的音频/语音增强:语音降噪、去混响、修复(bandwidth extension、declipping)、超分辨率等生成式增强方向的研究或工程落地经验;
④ 多模态音频生成:视频/文本到音频、音乐生成等跨模态生成模型;
⑤ 多模态音频基座模型(如 Qwen-Audio、CLAP、AudioMAE 等)的微调、评测与业务落地。
加分项:
1、参加过 DNS 等 Challenge 比赛有相关成绩者优先,在 Interspeech、ICASSP 等顶会发表过论文者优先;
2、熟悉主流音频大模型(如 Qwen-Audio、SALMONN 等)架构,有微调训练、数据构建、推理优化(量化/蒸馏/vLLM 部署)经验者优先;
3、有开源项目贡献或活跃的 GitHub 音频相关技术积累者优先;

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →