锦鲤求职

懂车帝

Post-Train Infra开发工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
团队定位:为公司模型迭代提供基建与保障,降本增效——降低算力成本,提高模型开发效率。
岗位定位:开发并优化 Post-Train(后训练)框架与基础设施,把环境、框架、稳定性等收进 infra,让算法专注于实验与业务效果本身。

岗位职责:
1、开发并优化 Post-Train 框架,包括但不限于:RL rollout 运行沙箱集群、Agentic RL 多轮调度、RL 训推不一致治理等,持续降低后训练的使用门槛;
2、训练效率优化:深入训练全链路,覆盖显存优化、吞吐与延迟优化、通信加速等手段,提升训练综合 ETTR 这一核心指标,提升资源整体利用率;
3、训练稳定性保障:解决算法同学遇到的通信 hang、OOM、框架参数、模型结构不支持、算子版本不支持等问题,保证训练任务的成功率;
4、跟进 SFT / DPO / GRPO 等后训练范式的工程落地,抽象通用组件沉淀到统一训练框架中。

岗位要求
1、熟悉大模型训练原理与流水线,有 Megatron / DeepSpeed / Swift 等框架的深入使用或二次开发经验;
2、理解分布式训练核心技术:数据/张量/流水线并行、NCCL 通信、显存管理、混合精度,有实际的性能调优经验;
3、有扎实的系统功底,能定位 hang、OOM、性能劣化等疑难问题,熟悉 nsys / 火焰图 / 日志链路排查手段;
4、对 RL 后训练(PPO / GRPO / Agentic RL)的系统架构有理解或强烈兴趣,了解 rollout 与 training 的协同模式;
5、自驱、能啃硬问题,愿意长期跟踪训练框架与系统方向的前沿进展。
加分项:
1、有 RLHF / Agentic RL 系统(rollout 集群、环境沙箱、异步采样调度)建设经验;
2、有大规模训练(千卡以上)稳定性保障或 ETTR 优化的量化成果;
3、在训练框架开源社区(Megatron / DeepSpeed / Swift / verl 等)有实质性贡献。

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →