岗位描述
岗位职责
1. 负责工艺文档的自动化解析、分类与信息抽取,建立文档特征索引库,解决人工整理效率低下的痛点,并建起大语言模型训练数据库。
2. 负责机器人运行日志、轨迹点位及视觉点云数据的清洗、降噪、标注与结构化转换,构建高质量的训练与验证数据集。
3. 设计并维护自动化数据预处理Pipeline(数据流管道),实现原始数据到业务特征的高效流转,提升团队整体数据迭代速度。
4. 参与数据质量标准的制定,编写数据文档与预处理SOP,确保算法输入端的准确性与可追溯性。
5. 配合业务部门开发数据可视化看板,实时监控数据分布异常与缺失值,建立主动预警机制。
岗位要求
1. 计算机科学、自动化、数学、人工智能等相关专业,硕士及以上学历优先。
2. 熟练掌握Python/C++编程,熟悉Pandas、NumPy、正则表达式及XPath解析库;了解SQL/NoSQL数据库操作。
3. 熟悉LLM算法基本原理, 熟悉点云/时序数据预处理常用滤波算法(如高斯滤波、去噪)。
4. 具备良好的工程化代码习惯,熟悉Linux开发环境及Git版本管理工具。
5. 有数据处理竞赛、Kaggle数据清洗实战或工厂MES系统实习经验者优先。
6. 逻辑缜密,对数据敏感且极具耐心,沟通能力强,英语四级及以上,能阅读英文技术文档及数据手册。