岗位描述
岗位职责
1、建设十亿~百亿级向量的生产管线:批量提取 embedding 的高吞吐推理链路,覆盖增量数据的每日流入、版本管理与质量校验;
2、建设与优化向量检索引擎:ANN 索引(IVF/HNSW/DiskANN 等)的选型、调优与自研扩展,向量量化(PQ/SQ/二值化)与降维(PCA/MRL)在召回与成本间的权衡,标量-向量混合检索的执行路径优化;
3、深入列式存储与数据湖格式(Lance/Parquet 等)底层,参与我们 Lance 分支的开发:存储布局、索引结构、增量写入下的索引实时性、大规模标量过滤(bitmap/B-tree/倒排)等;
4支撑上层数据挖掘与 curation 场景:为密度分析、长尾挖掘、多向量精排(late interaction)等提供高性能的底层能力,与算法同学共建从粗召回到精排的完整检索链路。
岗位要求
1、2027届硕士应届毕业生,计算机科学与技术、电子工程、通信工程、自动化等相关专业;
2、扎实的系统编程能力,熟练 Rust/C++/Python 之一,有独立排查性能问题的经验;
3、理解向量检索的原理而不止于调用,熟悉至少一种向量检索系统(Faiss/Milvus/Qdrant/LanceDB 等)的内部机制,或有列式存储、数据库内核、搜索引擎相关开发经验;
4、有真实的大规模数据处理经验(亿级行 / TB 级以上),对容量估算和量级账敏感。
加分项
1、参与过开源向量数据库、数据湖格式(Lance/Arrow/Parquet)或数据库内核的开发;
2、有 GPU 加速检索(Faiss-GPU/RAFT/cuVS)或大规模 embedding 推理优化经验;
3、熟悉 ColBERT 类 multi-vector 检索的工程化(存储压缩、两段式召回精排;
4、有自动驾驶、推荐、搜索等亿级以上向量场景的落地经验。