岗位描述
岗位职责
岗位定位
构建支撑物理 AI 模型训练与评测的算力基础设施,让海量人类视频数据与仿真合成数据高效驱动 VLA、VLM、世界模型等模型的规模化训练、Rollout 与评测,为公司 "数据 — 仿真 — 评测" 闭环提供稳定高效的算力底座。
岗位职责
建设大规模分布式训练基础设施:集群管理、任务调度、故障恢复与资源监控,保障训练任务稳定高效运行。
优化训练框架与性能:基于 PyTorch 生态(Megatron/DeepSpeed 等)进行并行策略、通信与算子优化,提升千卡级训练效率。
构建数据与算力的供给管线:打通数据湖、缓存与训练集群,为训练任务按需供给海量数据,降低数据 IO 瓶颈。
建设模型推理与评测基础设施:支持大规模 Rollout、仿真评测与模型迭代反馈的自动化运行。
优化 GPU 资源利用率与成本:实现弹性伸缩、混部调度与算力配额管理,沉淀工程规范与工具链。
岗位要求
本科及以上学历,计算机、软件工程、人工智能等相关专业,编程基础扎实(Python/C++/Go 至少精通其一)。
熟悉分布式系统与高性能计算,了解 GPU 架构、CUDA 或 NCCL 者优先。
了解大模型训练 / 推理技术栈(PyTorch、Megatron、DeepSpeed、vLLM 等)或有相关调优经验者优先。
具备较强的系统设计能力、问题定位能力与代码质量意识,有大规模集群或分布式训练项目经验者优先。
对 AI 基础设施方向有热情,学习能力强,能快速跟进业界前沿方案。