岗位描述
岗位描述
研究智能系统如何利用任务结果、环境反馈和评测信号,持续优化推理策略、记忆机制、Agent Harness 与训练数据,并进一步演化任务生成、能力诊断、验证信号和优化策略,以跨代能力增益、分布外泛化、非退化约束和单位计算收益为标准,探索可验证、可持续的 Recursive Self-Improvement。
岗位要求
1. 理论基础扎实:深厚的深度学习与优化理论功底,能从第一性原理建模问题;
2. 架构深入理解:熟悉 Transformer、MoE 及主流大模型底层实现;
3. 精通后训练范式:SFT、RLHF/DPO/PPO 等对齐算法,理解 Alignment 原理与挑战;
4. Agentic 实战经验:具备复杂 Agentic 系统(Tool-use / Reasoning / Planning)的训练与搭建经验;
5. 科学实验素养:能独立设计实验、严谨验证,在复杂工程约束下做出算法决策。
加分项:
1. 顶会论文发表或高水平竞赛金牌;
2. MoE 或新型 Attention 设计经验;
3. 长上下文(100K+)训练经验;
4. 100B+ 参数规模模型训练经验;
5. 数据分布建模与 Scaling 经验。