岗位描述
Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 演进。当前,我们正聚焦前沿技术突破,全力打造架构更先进、能力更卓越的下一代基座大模型,打造全球领先的多语言与自主智能体(Agentic LLM)技术体系。我们将通过对算法和数据策略的深入研究,建立科学的 scaling law 指导规划,攻克训练与推理加速瓶颈,打通从数据治理到智能涌现的确定性路径。我们追求将现有的技术做到极致。
职位描述
跟进业界前沿发展,支持文本,多模态,agent等大模型评估。能快速跑通业界新的开源benchmark,支持内部业务评测数据集构建。通过模型测评挖掘模型的弱项,驱动大模型迭代优化。
职位要求
1 完善自动化评测流程,包含但不限于传统评测,LLM as Judge,自动化弱项挖掘。
2 完善自动化数据生产流程,包含但不限于Self-Instruct,Evol-instruct,Synthetic Data RL。
3 有模型微调能力,能使用LLaMa-Factory,Megatron等框架训练模型解决实际业务问题。
4 代码能力优秀,熟悉linux环境,熟练掌握python/shell编码。有国际顶会论文发表者优先,有大厂大模型评测经验者优先。
5 计算机相关专业,硕士及以上学历,3年及以上相关经验。