岗位描述
岗位描述
我们正在探索可交互的生成式世界:由代码和游戏引擎维护场景状态,通过实时渲染的视觉条件引导视频模型,让用户能够连续
控制角色、车辆和视角,并在长时间交互中保持场景、物体身份与运动的一致性。
这个岗位会参与从数据构建、模型训练到交互系统落地的完整过程。我们关注生成画面的质量,也关注模型能否准确响应操作、
处理遮挡与接触,并持续稳定地生成。
你将负责:
1. 研发动作与视觉条件驱动的视频世界模型,提升控制精度、画面质量、空间一致性和物理合理性。
2. 探索因果视频生成、流式解码、历史缓存与长期记忆,解决长程生成中的内容漂移、身份变化和误差累积。
3. 研究条件编码与融合方法,将场景布局、深度、对象身份、相机和动作信息有效注入模型,保证训练与推理使用一致的数据定义。
4. 建设训练数据管线,结合程序化场景、游戏引擎与视频重建,构造可控、可重放、覆盖不同时长和交互行为的数据。
5. 开展模型微调、少步蒸馏与推理优化,降低交互延迟;建立短片和长程交互评测,通过实验定位问题并推动改进。
岗位要求
我们希望你具备:
1. 扎实的机器学习基础,熟练使用 Python、PyTorch,能够独立完成训练、调试、评估与问题分析。
2. 在视频生成、扩散模型、生成式世界模型或相关方向有深入项目经验,理解模型结构、训练目标与采样过程。
3. 具备大模型训练实践,熟悉分布式训练、混合精度和显存优化,能够排查数值稳定性、数据与性能问题。
4. 能够设计有说服力的对照实验,区分数据、模型、训练分布和推理机制带来的影响。
5. 对可交互生成有持续兴趣,愿意查看生成视频、复现失败案例,并把研究结论落实为可运行的系统。
以下经历会是加分项:
1. 自回归或因果视频模型、长序列建模、长期记忆、蒸馏或量化经验。
2. 熟悉视频生成模型的流式推理与推流加速,有分块生成、KV Cache 优化、编解码流水线或低延迟视频推流实践者优先。
3. 游戏引擎、计算机图形学、三维视觉、场景重建或仿真数据生成经验。
4. 主导过生成模型训练或交互式产品落地,有相关论文、开源项目或可展示的系统。
欢迎随简历附上代表性论文、代码或演示视频,并说明你负责的部分、解决的问题和实验结论。我们重视你把一个问题研究清楚、实现出来并验证有效的能力。