岗位描述
岗位职责
1.主导设计和研发下一代分布式多级分层缓存加速系统,基于 GPU 主机本地内存、NVMe SSD、远端并行文件系统构建大容量弹性扩缩容的多级缓存架构,实现数据按需与透明加速;
2.参与设计和研发百 PB 规模的分布式文件缓存系统,支撑自动驾驶、大语言模型等业务的大规模分布式 AI 训练集群;
3.设计并实现智能数据放置与生命周期管理策略(如基于访问热度的分层调度、TTL/LRU 淘汰、预取优化),降低 GPU 因存储 I/O 导致的停顿;
4.参与研究和落地高性能存储软硬件技术栈,如 GPU Direct Storage、NVMe-oF、RDMA、Burst Buffer 等,持续优化端到端数据通路性能;
5.参与元数据管理系统设计,实现高效的路径查找和缓存机制,保证元数据访问延迟在毫秒级。
岗位要求
1.本科及以上学历,5 年以上分布式存储系统、缓存系统、文件系统或相关大规模系统软件研发经验;
2.熟练掌握 Rust、C/C++、Golang 中至少一种系统编程语言,具备在大型软件项目中应用AI Coding 的经验;
3.深入理解分布式系统设计原理(一致性、复制、分片、容错),有 Curvine、Alluxio、JuiceFS、Mooncake 等系统研发经验者优先;
4.熟悉 Linux 内核存储栈或具备用户态文件系统开发经验;
5.了解 AI 训练数据流(PyTorch DataLoader/Dataset、流式数据加载)或推理引擎(vLLM、SGLang)工作原理者优先;
6.有强烈的技术好奇心,关注业界前沿技术,具备从论文/开源项目快速落地的能力。