岗位描述
核心目标
参与云端大规模端到端语音识别(ASR)及相关算法体系的研发与迭代,在导师带领下深入声学模型优化、解码器调优及前沿方向探索,成长为能独立承担核心算法模块的语音算法工程师。
岗位职责
1. ASR 核心算法研发:参与端到端 ASR 系统的声学模型(AM)与语言模型(LM)优化及解码器调优,在导师指导下完成模型训练、效果验证与迭代,提升远场、高噪声、口音、多语种等复杂场景下的识别准确率。
2. VAD 算法研究:参与 VAD(语音端点检测)算法的设计与训练实验,探索远场、高噪声、双讲及复杂背景音下的静音截断与语音触发优化方案。
3. 前沿技术探索:跟踪 LLM + Speech、长音频对齐、多语种混合识别、流式识别等前沿方向,参与预研实验与技术调研,撰写技术分析报告。
4. 工程落地实践:参与算法云端部署与推理优化的工程实践,学习并实践模型压缩、蒸馏、量化及推理加速等技术,理解高吞吐、低延迟的工程约束。
5. 数据闭环参与:参与自动化数据标注与清洗流程的建设与优化,通过弱监督、主动学习等手段协助构建持续迭代的数据飞轮。
6. 技术积累与成长:持续阅读语音领域顶会论文(Interspeech、ICASSP 等),参与组内技术分享,逐步建立对语音识别全链路的系统性理解。
任职要求
1. 学历与专业:声学、信号与信息处理、模式识别与智能系统、计算机、人工智能等相关专业,硕士及以上。
2. 理论基础:扎实的数字信号处理与深度学习基础,熟悉常用语音特征提取(MFCC / Fbank 等);对主流 ASR 架构(CTC / RNN-T / Attention(AED) / Conformer 等端到端模型)有一定理解或研究经历。
3. 编程与框架:掌握 Python / C++,具备良好的算法实现能力;使用过 PyTorch / TensorFlow 至少一种深度学习框架;有 Kaldi / WeNet / ESPnet 等语音框架使用经验者优先。
4. 开发环境:具备 Linux 开发基础,了解多线程、异步编程基本概念。
5. 学术素养:具备良好的英语论文阅读能力,关注语音领域顶会(Interspeech、ICASSP 等)前沿进展。
6. 综合素质:对语音识别方向有持续热情,具备较强的学习能力、问题分析能力和团队协作意识。
加分项
1. 竞赛获奖:在语音国际竞赛(CHiME、Interspeech 相关评测、SpeechIO 等)中获得前排名次。
2. 顶会论文:在 Interspeech、ICASSP、ICLR、ACL 等语音或 AI 领域顶会/顶刊发表过相关论文(一作或核心作者优先)。
3. 科研经历:在导师课题组有语音识别/语音处理/语音增强方向的研究经历,且有具体成果(论文/专利/系统Demo/竞赛排名)。
4. VAD 方向经验:有基于神经网络的 VAD 开发或研究经验,对人声、噪声、音乐及环境异响的区分有一定实践。
5. LLM + Speech:对 LLM + Speech 结合方向有了解或实践经历,或对 Whisper 等模型有调优/复现经验。
6. 工程优化经验:有模型量化、剪枝、蒸馏或 GPU 推理优化的学习或实践经验。
7. 开源贡献:在 Kaldi / WeNet / ESPnet / Whisper 等开源语音项目有代码贡献。