锦鲤求职

滴滴

网约车技术部-算法实习生

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责(具体工作内容)

我们团队正在建设全双工语音对话大模型及其配套的语音交互能力,负责司乘的行程安全保障,模型需要像真人安全客服一样"听得懂、接得快、说得自然”, 关注的核心研究问题包括:

* 全双工对话建模:双流并行建模、轮转预测、打断建模、时间对齐机制

* 流式低延迟语音生成:流式 TTS 首包延迟优化、语音 token 化、流式声学建模

* 语音多模态大模型:语音-文本联合建模、模态对齐与解耦、副语言信息(情感/语气)理解与生成

* 模型在真实车内安全场景的落地:话术可控性、业务评测体系

岗位职责

* 全双工对话模型研发:参与全双工语音对话大模型的训练与改进——轮转/打断/backchannel 的行为建模、时间对齐机制设计、双流或多流架构实验;跟踪并复现 SOTA 工作,在其基础上做面向安全场景的改进

* 语音 token 化与流式生成研究:参与语音 tokenizer 对比实验(离散 codec vs 连续 embedding、单码本 vs 多码本)、流式 TTS / 语音解码器的训练与首包延迟优化、情感与音色可控生成

* 语音多模态大模型实验:参与语音-文本交错预训练、模态对齐训练、Thinker-Talker 类架构实验;研究与业务能力的结合(函数调用、知识检索在语音模态下的行为)

* 评测与消融研究:基于学术基准 + 自建安全场景评测集,系统评测候选模型与方案(停顿处理、backchannel、轮转平滑、打断管理),设计消融实验定位能力瓶颈

* 数据工程:全双工对话数据构造(真实带打断/重叠标注的双人对话稀缺,需要研究生成/合成/课程训练等数据策略);安全场景话术数据集的结构化整理与清洗

* 前沿跟踪与技术报告:跟踪 ICASSP / Interspeech / ACL / NeurIPS / AAAI 等会议的语音对话方向论文,定期输出精读报告与选型建议,参与团队技术决策讨论

任职资格(学历、目标院校、语言、技能、性格等要求)

硕士/博士在读优先

专业:计算机科学、人工智能、自动化、声学、电子信息等相关专业

研究经历匹配,以下方向任一有科研经历即可:

*语音对话模型 / 口语对话系统(spoken dialogue)

*语音多模态大模型(speech LLM / audio-LLM / omni-modal)

*TTS / 语音合成(含流式合成、voice cloning)

*ASR / 语音识别、语音 token 化 / 神经编解码器(speech codec)

经历形式:实验室科研项目、发表论文(ICASSP/Interspeech/ACL/NeurIPS/AAAI 等)、开源项目贡献、语音类竞赛获奖,任一均可

注:若有其他疑问 可邮件咨询internrecruit@didiglobal.com

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →