岗位描述
岗位描述
团队介绍:
我们是高德全栈语音团队,覆盖语音生成与语音交互两条技术主线。本岗位聚焦语音生成方向:自研 TTS 基座大模型、多语种与可控语音生成、连续值自回归建模、指令驱动的可控合成、广义音频生成(T2A:语音 / 音效 / 环境声统一建模),以及配套的海量语音数据与自动评测体系。生成能力支撑语音导航、AI 领航员、AI 语音助手、IP 语音定制与虚拟陪伴、国际化、智能外呼,以及有声书 / 播客 / 交互式播客等业务场景。团队鼓励跟进前沿、发表论文与申请专利。
你将参与的工作
在导师指导下参与语音生成方向从数据、建模、部署到业务的完整链路,既有扎实的基础工作,也有前沿探索:
1. 语音生成建模(核心方向)
○ 主力方案:围绕当前 TTS 方案(离散语音 token + flow matching decoder)持续迭代,提升音质、稳定性、说话人相似度与韵律自然度,定位并修复线上 badcase;
○ 前沿探索:连续值自回归建模、多码本并行 / 延迟模式、指令驱动的可控合成(音色 / 风格 / 情感 / 韵律解耦)、广义音频生成(T2A)、面向人类偏好的强化学习优化。
2. 数据与评测
○ 数据:语音数据的清洗、切分、标注与质量分析,数据筛选与配比策略,为训练提供更干净、更有效的数据;
○ 评测:建设超越 WER 与 MOS 的多维自动化评测框架,为建模与数据迭代提供客观度量。
3. 模型效率与部署:推理加速、蒸馏 / 量化、模型小型化,以及非自回归(NAR)等低延迟生成范式,压低首包与端到端延迟、降低部署成本,支撑流式与端侧落地。
4. 业务落地:对接语音导航、AI 语音助手、IP 语音定制、有声书 / 播客等场景的具体需求,把算法能力转化为可衡量的业务指标;并探索交互式播客(可打断、可追问、按听者兴趣动态改写)等生成侧新形态。
岗位要求
我们希望你
1. 在读硕士 / 博士研究生,或表现优异的本科生;计算机、人工智能、软件、数学等相关专业;可全职实习并持续 6 个月以上。
2. 扎实的代码能力,熟练使用 Python 与 PyTorch。
3. 熟悉 Transformer 与深度学习基础;了解 diffusion / flow matching / 自回归 等生成模型中的一种或多种。
4. 在以下任一方向有研究、课程项目或实习经验:语音生成 / TTS、生成模型、大语言模型、多模态大模型。
5. 对数据敏感,具备从数据中发现问题的习惯;对新技术、新工具快速上手。
6. 自我驱动,沟通与协作能力好,能在边界不清的问题上主动推进。
加分项
1. 在 ICASSP、Interspeech、TASLP、ICLR、NeurIPS、ICML、ACL 等顶级会议 / 期刊发表论文,或有被业界采用、复现的开源模型 / 框架 / 技术报告。
2. 参与过语音生成 / TTS 系统从研究到线上服务的完整闭环。
3. 了解 Megatron 等分布式训练框架,或 slime / swift / veRL 等后训练框架。
4. 具备 harness engineering 能力:为模型搭建工具与接口定义、上下文组织、评测与验证回路等外围系统。
5. 在 ACM/ICPC、NOI/IOI、Codeforces、Kaggle 等竞赛获奖,或在 Blizzard Challenge、CHiME、DCASE、ICASSP Grand Challenge 等语音 / 音频公开评测中取得优异成绩。