岗位描述
岗位描述
1. 评测数据挖掘
(1) 针对预训练(含mid-training,下同)模型在coding,cowork,长尾知识,长文本能力等方面的弱点,设计并构建具有可扩展性的自动化评测方案及高质量数据集。
2. 评测数据治理
(1)整合高质量公开评测集和私有评测集。为不同训练阶段、不同领域、不同优化目标(模型结构/数据配比/主线模型迭代)定制评测方案,挑选质量最高、领域最合适、区分度最好的评测数据与指标。
3. 评测基建完善
(1)与工程团队合作提高评测系统的效率与稳定性,完善评测故障分析与检测,并推动文本评测与Agent评测的自动化与可视化。
4. 预训练-后训练评测一致性探索
(1)设计Pretrain + LightSFT的数据配比和训练策略并搭建相关pipeline,实时检测预训练模型的agentic潜力。
(2)设计面向后训练agent能力导向的预训练评测范式,挖掘高预测性的external metrics以及internal indicators,寻找上限更高、潜力更强的预训练基座。
岗位要求
1. 计算机、人工智能、数学等相关专业本科及以上在读,可实习六个月及以上。
2. 优秀的数据sense,扎实的算法基础和 (vibe-) coding动手能力。
3. 具备对基础模型与Agent研发的热情,认同评测对模型优化的巨大价值。
4. 加分项:
(1)有基础模型团队实习经历;
(2)LLM评测/Benchmark构建/数据合成经验;
(3)相关顶会论文。