锦鲤求职

长鑫存储

大模型数据主任工程师 LLM Data Staff Engineer(J21151)

锦鲤会替你打开官网网申、按简历自动填表提交,你只需要在关键步骤确认。

岗位描述

岗位职责
1. 训练数据体系构建:主导半导体领域大模型训练数据体系建设,包括领域语料(芯片设计、工艺、测试、失效分析文档、专利、行业报告)的采集、清洗、去重、质量评估与分级管控;
2. 文档解析与数据生产Pipeline构建:设计并实现针对PDF、PPT、图表(wafer map、时序图、参数表)等非结构化文档的解析、结构化抽取与入库,持续优化解析准确率与吞吐能力;
3. 术语库与知识库建设:主导半导体专业术语与缩写的归一化与对齐工作,支撑知识图谱构建及检索增强生成(RAG)语料准备;
4. 指令数据与评测集运营:设计并运营有监督微调(SFT)指令数据与领域评测集,协同工艺、设计、测试专家制定标注规范,构建术语问答、参数查询、故障诊断类评测数据,跟踪模型幻觉问题并迭代优化;
5. 大规模分布式数据处理平台搭建:基于Spark/Ray等框架搭建分布式数据处理任务,建立数据元信息、血缘与版本管理体系,保障敏感数据的合规流转与脱敏。

岗位要求
1. 教育背景与专业知识:硕士及以上学历,计算机、数据科学、AI或相关专业,能区分预训练、有监督微调、检索增强生成各阶段对数据质量与格式的不同要求;
2. 专业技能与资格:能使用Python开发并维护数据Pipeline,能使用Spark、Flink或Ray等分布式框架完成TB级以上数据处理与性能调优;能使用非结构化文档解析工具(如PyMuPDF、OCR)完成PDF、图表、表格的结构化抽取;能通过Git、CI/CD进行版本管理与持续集成;
3. 行业与专业经验:2年以上数据工程或大语言模型(LLM)数据处理相关全职工作经验,具有半导体电子行业文档处理经验者优先考虑;
4. 项目/任务成果:主导完成至少一个大规模离线数据Pipeline从开发到上线的完整交付;主导完成至少一个LLM语料治理或非结构化文档解析项目,涵盖需求分析、方案设计、落地迭代全阶段;
5. 其他要求:具有数据安全与合规意识,能设计敏感数据脱敏与分级保护方案;具有跨团队协作能力,能与领域专家及算法工程师对齐需求并主动推动问题闭环;有HuggingFace生态或开源语料项目贡献者优先考虑。

人工智能方向的申请准备

先核对岗位要求与自己的经历,再准备档案、投递和面试。

阅读求职步骤与示例 →