岗位描述
关于我们
文远知行是一家快速发展的自动驾驶公司,我们致力于打造稳定、高效、智能的研发体系,以加速核心自动驾驶算法的迭代与落地。数据闭环(Data Loop)团队是公司核心的基础架构部门之一,专注于构建支撑自动驾驶持续进化的“数据飞轮”——从数据采集、传输、存储、处理,到模型训练、评测与部署的完整自动化闭环。
在这里,你将与世界一流的工程团队并肩作战,深入接触自动驾驶数据基础设施与AI系统的前沿工程实践。我们推崇敏捷开发、OKR结果导向,鼓励以创造性的方式解决问题,拥抱变化,持续学习。
在AI时代,数据是自动驾驶模型进化的核心燃料。数据闭环的本质,就是让数据高效地流动起来,驱动模型持续迭代——而这需要将云原生的系统思维与深度学习的算法理解深度融合。我们正在寻找兼具这两种视角的新生力量。
岗位职责
作为数据闭环团队的新生力量,你将在资深工程师的全程指导下,参与构建和优化支撑海量数据流转与模型迭代的工程基础设施。你的工作将直接驱动算法团队的研究与落地效率:
云原生基础设施构建:参与基于Kubernetes、Docker等容器化技术的云原生平台开发与维护,构建高可用、易扩展、低延迟的数据闭环服务架构。
数据流水线开发:参与设计并实现从数据采集、清洗、标注到训练、评测的全链路自动化数据处理流水线,支撑PB级数据的高效流转。
AI基础设施与MLOps:参与构建面向大模型与深度学习训练的AI基础设施,包括模型存储、版本管理、训练任务调度与评测系统的开发与优化。
系统性能优化:参与大规模分布式系统的稳定性建设,优化高吞吐、高并发场景下的系统性能,完善监控与告警体系。
跨团队协作:与算法团队紧密沟通,理解模型训练与数据处理的真实痛点,用工程化的手段推动数据闭环效率的持续提升。
任职要求
教育背景:计算机科学、软件工程、人工智能或相关专业,本科及以上学历
计算机基础:扎实的计算机基础,包括数据结构与算法、操作系统(Linux)、计算机网络等,对底层原理有探索兴趣。
编程能力:掌握至少一种主流编程语言(Python / C++ / Go 均可),有课程项目或个人项目经验即可(Python或C++有基础者优先)。
云原生与技术热情:对云原生技术(如Docker、Kubernetes)有基本了解或浓厚兴趣,愿意深入理解分布式系统的设计与实现。
AI与深度学习兴趣:对深度学习、大模型或机器学习系统有基本了解或强烈兴趣,理解数据在模型迭代中的核心价值。
学习与解决问题:有好奇心和钻研精神,遇到不懂的问题能主动查阅文档或搜索资料寻找答案。
沟通与协作:能阅读基本的英文技术文档,有良好的团队合作意识和责任心。
加分项(满足任意一项即可,非硬性要求)
了解PyTorch、TensorFlow等深度学习框架,或有相关课程/项目经验。
了解数据处理相关技术(如Spark、Ray、Kafka等)或大数据处理的基本概念。
了解MLOps / LLMOps相关概念,如模型训练、推理、微调等。
有数据流水线、ETL或数据平台相关项目经验。
在GitHub上有自己维护的项目、课程作业或开源贡献。
了解自动驾驶数据闭环的基本理念。
我们提供的成长机会:
深度参与数据闭环从采集、处理到模型训练、评测的完整工程链路。
在云原生与AI的交汇点上建立系统化的工程经验,掌握Kubernetes、分布式系统、MLOps等前沿技术。
接触真实生产级的大规模数据处理系统与自动驾驶复杂场景。
与算法、训练、部署等多团队协作,理解AI系统落地中的真实工程问题。