岗位描述
岗位职责
岗位描述
我们正在招聘语音算法实习生,参与语音合成、端到端语音大模型、全双工语音交互及多模态生成方向的前沿研究与产品落地。你将探索自然、富有表现力、低延迟且支持实时交互的语音生成技术,打造更加智能、自然和拟人化的语音交互体验。
岗位职责
1.参与语音合成算法的研发与优化,包括声音克隆、多语言语音合成、情感与韵律控制、长上下文语音合成,以及基于强化学习的后训练与对齐方法等。
2.参与下一代端到端语音交互技术研发,包括音频感知、对话理解与推理、语音生成的一体化建模,以及音频表征学习和全双工交互能力建设。
3.探索低延迟、流式语音交互技术,优化实时响应、用户打断、轮次管理、重叠语音处理及复杂声学环境下的交互体验。
4.参与音视频多模态生成研究,包括语音、音乐、音效、文本、图像和视频等模态之间的联合理解与生成。
5.跟踪学术界和工业界的前沿技术进展,复现和评估最新研究成果,推动算法迭代、技术创新与产品落地。
岗位要求
任职要求
1.计算机、人工智能、电子信息、自动化、数学或相关专业本科及以上在读。
2.熟悉 Python,具备良好的编程能力、数据结构与算法基础。
3.熟悉 PyTorch 等至少一种深度学习框架,能够独立完成模型训练、调试和实验分析。
4.对语音合成、端到端语音大模型、实时语音交互或多模态生成具有浓厚兴趣。
5.具备较强的论文阅读、算法复现、问题分析和团队协作能力。
6.每周可实习不少于 3 天,能够连续实习 3 个月及以上。
加分项
1.具有 TTS、语音大模型、端到端语音交互或音视频生成相关项目及科研经验。
2.熟悉 CosyVoice、Ming-UniAudio、Qwen-Omni、Cosmos 等代表性模型、技术路线或相关开源项目。
3.熟悉神经音频编解码器、离散语音 Token、连续语音表征、多码本建模、流式生成或语音与文本联合建模。
4.具有全双工语音系统相关经验,了解 VAD、AEC、语音降噪、重叠语音检测、端点检测、Turn-taking 或用户打断机制。
5.熟悉 ASR、说话人识别、语音情感识别、音频理解等相关技术。
6.具有大模型预训练、监督微调、强化学习、偏好对齐或分布式训练经验。
7.在相关领域发表过论文,或在开源社区、算法竞赛中取得过突出成果。
你将获得
1.深度参与语音合成、多模态生成、端到端语音大模型及全双工语音交互项目的机会。
2.完整接触数据构建、模型训练、后训练与对齐、交互策略、推理优化和产品落地的技术链路。
3.与经验丰富的算法及工程团队合作,获得针对性的技术指导和成长支持。
4.表现优秀者可获得长期实习或正式岗位机会。