锦鲤求职

阶跃星辰

实习-后训练基础设施算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位方向

参与大模型后训练中的 Agent 数据合成、评测诊断与基础设施建设,围绕 Long-Horizon Agent、代码 Agent、工具调用、多模型协作等方向,构建可用于 SFT/RL 的高质量轨迹数据与自动化评测体系。

岗位职责

设计并搭建面向 SFT/RL 的 Agent 轨迹合成 pipeline,支持多模型、多 scaffold、多策略生成训练数据;

建设 Agent 执行框架,支持任务规划、工具调用、代码修改、测试执行、失败恢复与 checkpoint 续跑;

构建 Agent 评测与诊断系统,支持 Rubric Eval、LLM-as-Judge、Failure Onset 定位和轨迹清洗;

接入 SWE-Bench、代码修复、工具调用、长上下文任务等 benchmark,形成自动化评测闭环;

分析模型在规划、工具使用、代码理解、错误恢复等方面的能力短板,并反哺数据与训练迭代。

任职要求

熟悉大模型后训练流程,了解 SFT、RLHF、GRPO/PPO 等方法;

具备扎实的 Python 工程能力,能够独立搭建数据 pipeline、评测系统或 agent runtime;

熟悉 LLM Agent 基本范式,如 ReAct、Planner-Executor、Tool Calling、Multi-Agent 等;

有代码 Agent、SWE-Bench、自动化代码修复、工具调用或长上下文任务经验者优先;

对数据质量、评测可信度、失败样本分析和训练闭环有较强理解。

加分项

有 Claude Code、Codex、OpenHands、SWE-agent、DeerFlow、MCP 等相关经验;

有大规模 SFT/RL 数据生产、trajectory synthesis、LLM-as-Judge 或 verifier 设计经验;

熟悉容器沙箱、Ray、Kubernetes、异步任务调度、Git patch/test loop 等工程系统;

熟悉 context engineering、memory、summary、retrieval、context compression 等长上下文技术。

期望产出

搭建稳定可复用的 Agent 数据合成与评测 pipeline;

提升代码任务、工具调用任务、长任务规划类 benchmark 的通过率;

形成从轨迹生成、评测诊断、数据清洗到 SFT/RL 训练的闭环。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →