岗位描述
关于团队
Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 演进。当前,我们正聚焦前沿技术突破,全力打造架构更先进、能力更卓越的下一代基座大模型,打造全球领先的多语言与自主智能体(Agentic LLM)技术体系。我们将通过对算法和数据策略的深入研究,建立科学的 scaling law 指导规划,攻克训练与推理加速瓶颈,打通从数据治理到智能涌现的确定性路径。我们追求将现有的预训练技术做到极致。
岗位职责
模型结构设计与优化: 深入研究并优化大语言模型的基础架构(如 Transformer 及其变体,MoE 等),探索高效的 Attention 机制、位置编码及新型网络结构,突破模型长上下文(Long-context)和推理效率的瓶颈。
预训练策略与 Scaling 研究: 负责超大规模参数模型的预训练工作,研究 Scaling Laws 并指导算力与数据规模的最优分配;探索并落地前沿的训练策略(如 Curriculum Learning、优化器改进、学习率调度等),持续提升模型基础能力。
预训练数据策略: 深入分析海量多模态/多语言预训练数据分布特征,设计科学的数据混合(Data Mix)与采样算法;探索数据质量与模型能力之间的关联,针对性提升模型在逻辑推理、代码编写、数学计算等核心领域的表现。
分布式训练与稳定性保障: 基于大规模算力集群(千卡/万卡级别),联合系统工程团队优化分布式训练框架(如 DeepSpeed、Megatron-LM),解决训练过程中的 Loss Spike(梯度爆炸/不收敛)问题,保障大规模训练的高效性与极高稳定性。
岗位要求
学历专业: 计算机、人工智能、数据科学、数学等相关专业硕士及以上学历。
编程功底: 具备扎实的算法与数据结构功底,精通 Python,熟练掌握 C++,具备出色的工程实现能力。
分布式计算: 熟悉至少一种主流大规模分布式训练框架(如 Megatron-LM, DeepSpeed, Colossal-AI),深刻理解数据并行、张量并行、流水线并行及 ZeRO 等内存优化技术。
问题解决: 具备极强的 Debug 能力和问题诊断能力,能够快速定位并解决模型训练中的算法缺陷与系统瓶颈。