岗位描述
1、参与企业级知识库与知识图谱的核心算法研发,协助完成实体抽取、关系抽取及知识融合等任务;
2、参与搭建并优化RAG(检索增强生成)底座,协助实现稀疏+稠密混合检索、向量召回与Query理解等算法;
3、协助研发KBQA问答能力,跟进复杂多跳问答场景优化,协助降低大模型幻觉率;
4、参与数据底盘的治理算法开发,包括文档清洗、结构化解析、多源数据归一化等;
5、配合优化向量存储、文本分块及批量向量化等底层数据加工链路;
6、基于线上业务数据迭代模型,输出自动化评估指标;
7、配合大模型与后端团队,协助算法的工程化部署与API接口封装。
1、2027届本科及以上学历毕业生,计算机、人工智能、自然语言处理、数据科学等相关专业;
2、具备扎实的NLP基础,熟悉分词、NER、关系抽取、文本匹配等基础理论;
3、熟练使用PyTorch或TensorFlow框架,熟悉BERT类预训练模型及模型微调;
4、了解BM25、ES及Milvus/FAISS等向量检索技术,掌握混合检索基础方案;
5、了解知识图谱基础(实体消歧、对齐)及RAG链路原理;
6、熟练掌握Python,具备较好的工程实践能力,能独立完成基础算法实验与验证;
7、对AI和大模型应用有日常使用习惯和探索热情。
【加分项】
1、有文档解析/OCR相关项目经历;
2、有多模态知识库、海量数据治理或企业级KBQA系统开发实践经验。