锦鲤求职

虎牙

(2027届)AIGC语音大模型算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

团队介绍:

多模态算法-语音团队专注于语音/音频大模型的AIGC技术研发与产品落地。团队自研的语音合成系统已服务于虎牙直播间、实时多模态数字人、硬件智能体等核心业务,覆盖Zero-Shot语音克隆、情感/风格控制、音频标签驱动合成等前沿方向。我们正在构建从数据标注→模型训练→推理加速→线上部署的全链路技术体系,期待你的加入。

岗位职责:

1、负责语音合成(TTS)核心算法研发,包括但不限于Zero-Shot语音克隆、音频标签(语速/音调/音量/情感)控制合成、高自然度音色定制、跨语言/跨情感泛化;

2、负责语音识别(ASR)及实时交互技术的研发,包括热词注入、轮次转换、说话人识别等方向;

3、持续优化合成语音的音质、自然度与情感表现力,主导音频标签体系设计与数据增广策略;

4、面向端/云侧业务场景,进行模型轻量化(TensorRT/ONNX量化、裁剪)与推理加速,保障线上稳定性;

5、主导音频生成技术在虎牙核心业务场景的落地交付,跟进并解决直播、数字人、硬件智能体等真实复杂场景下的技术挑战。

任职要求:

1、2027届硕士及以上学历,计算机科学、信号处理、人工智能等相关专业;

2、扎实的数学与算法基础,熟悉主流TTS/ASR算法架构(如CosyVoice、SeedTTS、DotsTTS等),了解离散音频表征(Audio Codec)、连续表征(VAE)、自回归/非自回归、扩散模型等技术范式;

3、熟练掌握PyTorch,具备良好的工程落地能力;熟悉C++/CUDA或有TensorRT/ONNX推理优化经验者优先;

4、强烈的责任心与自驱力,能洞察业务需求并将技术突破转化为产品价值;

5、具备大模型编码与研发能力。

加分项:

1、在Interspeech、ICASSP、NeurIPS、ICML、ACL等顶会发表过语音/音频生成相关论文;

2、有语音合成/音频生成方向的高星开源项目或技术竞赛优异成绩;

3、有TTS数据标注体系设计或音频标签体系构建经验。

你将获得:

1、从模型研发到线上部署的端到端实战经历;

2、直接影响亿级用户产品的技术挑战;

3、与资深算法工程师并肩作战的快速成长机会。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →