锦鲤求职

Shopee

(ASP Intern)LLM-大模型预训练数据算法工程师

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

关于团队

Compass 是由 Shopee 研发的面向全球竞争的超大规模多语言模型,具备强大的跨文化理解、复杂逻辑推理与自主执行能力。依托全球新兴市场(尤其是东南亚)海量的多语言、多文化数据优势,Compass 系列模型已成功实现了从 v1 到 v3 演进。当前,我们正聚焦前沿技术突破,全力打造架构更先进、能力更卓越的下一代基座大模型,打造全球领先的多语言与自主智能体(Agentic LLM)技术体系。我们将通过对算法和数据策略的深入研究,建立科学的 scaling law 指导规划,攻克训练与推理加速瓶颈,打通从数据治理到智能涌现的确定性路径。我们追求将现有的预训练技术做到极致。

岗位职责

参与核心算法与数据构建:协助设计基于多维指标(Loss/Embedding 等)的数据选择与采样算法;参与自动化合成数据链与蒸馏数据的实验验证,探索模型能力与数据配比的 Scaling Laws。

协助海量数据挖掘与清洗:参与全网数据选取策略的优化,挖掘 RAG 场景的时效性数据;编写高效脚本,清洗低质站点与链接,提升训练数据纯净度。

探索数据质量评测与去重:协助研发大规模数据的清洗、去噪与核心去重(如 MinHash、向量去重)算法;参与搭建自动化数据评分模型,追踪数据的分布变化。

支持数据平台与基建优化:在 Mentor 指导下使用分布式处理框架(Spark/Ray 等),参与自动化预训练数据流水线的建设与核心代码性能优化。

职位要求

必须项

学历专业: 计算机、AI、数据科学或数学等专业本科及以上学历。

编程功底: 精通 Python,熟练掌握 C++ 或 Rust,具备扎实的计算机系统基础。

数据与工程: 熟练使用 Spark/Ray/SQL 等分布式工具链,具备 TB~PB 级海量数据处理与计算引擎调优能力。

AI 与算法: 熟悉 LLM 预训练流程与 NLP 基础,熟练使用 PyTorch/TensorFlow;精通数据挖掘、清洗去噪与文本处理。

业务认知: 对“高质量预训练数据”的特征与分布有深刻理解,具备强问题诊断与跨团队协作能力。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →