锦鲤求职

原力灵机

模型平台技术负责人 (平台全栈方向)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
- 平台架构与全栈研发:负责平台控制台、后端服务、任务编排及模型基础设施的整体设计,定义模块边界、接口规范和数据模型;持续参与核心代码开发、代码评审和跨模块问题定位。
- 模型全生命周期建设:贯通模型接入与注册、数据集管理、训练任务、评测调用、模型部署和推理服务,建立数据、模型、任务及实验结果之间的版本关联与追溯能力。
- 后训练与运行时建设:协同算法团队,支持 DAgger、RECAP 等后训练流程的平台化接入,打通数据回流、训练执行、评测反馈与模型更新;建设配套任务运行时、资源管理和异常恢复能力。
- 平台系统能力建设:完善权限管理、任务调度、资源隔离、日志监控、告警、发布及回滚机制,建立平台性能、稳定性、容量与成本管理基线。
- 私有化与技术交付:负责离线安装、环境适配、部署升级、故障诊断及运维文档,推动训练与推理流程在目标环境中落地,形成可复用的交付方案。
- 团队与项目推进:带领研发团队,制定阶段目标、任务分工和验收标准,组织技术评审、自动化测试及版本发布,管理项目风险和技术债。
- 跨团队协作:与算法、评测、机器人系统及客户交付团队协作,明确接口与责任边界,完成端到端联调、场景验证和交付验收。

岗位要求
- 5 年以上平台、企业软件或基础设施研发经验,其中至少 3 年 AI 平台、MLOps、训练平台或模型服务相关经验。
- 主导过生产级平台从零建设、重大重构或完整交付,能够将业务需求转化为可落地的架构、研发计划和验收标准。
- 具备扎实的后端与全栈工程能力,熟练掌握 Python、Go、Java 等至少一种后端语言;熟悉 TypeScript / JavaScript 及 React、Vue 等主流前端框架,能够独立完成关键功能的前后端设计、开发与联调。
- 熟悉模型从数据准备、训练 / 后训练、实验管理、模型注册、评测到部署推理的完整流程,在训练平台、模型服务、数据平台中至少两个方向具备实际建设经验。
- 熟悉 Linux、Docker、Kubernetes 及常见分布式系统组件,具备任务编排、异步处理、数据库、对象存储和服务接口设计经验。
- 理解训练与推理任务的资源需求,能够与算法及训练工程师协作,处理任务失败、环境依赖、资源利用率和性能问题。
- 具备自动化测试、持续集成与发布、可观测性和稳定性建设经验,有较强的系统联调及复杂故障定位能力。
- 有约 5—10 人团队的管理或技术领导经验,能够协调前后端、训练工程和测试等不同专业角色,在有限资源下作出合理的优先级与技术取舍。
加分项
- 有具身智能、机器人学习、VLA / VLM 平台或相关模型工程经验。
- 有 DAgger、RECAP、模仿学习或强化学习流程的工程化接入经验。
- 有 GPU 任务调度、分布式训练、推理服务优化或容量与成本分析经验。
- 有企业客户私有化、离线环境部署、异构软硬件适配及现场交付经验。
- 有将内部研发工具建设为标准平台产品,并推动多团队或多客户持续使用的经验。

后端开发方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →