岗位描述
岗位描述
研究领域:
数据挖掘
项目简介:
全网数据是大模型训练语料最大的数据来源,互联网是最重要的世界知识来源之一。但全网数百万亿的网页规模,也会带来很大的挑战,下面围绕几个关键层次展开说明下:
1. 全网高价值内容稀疏性 — Common Crawl等采集数据中仅不到5%满足LLM/RAG质量要求,数据转化率是核心瓶颈。进一步扩展到全网范围,这个转化率会更低。
2. 传统PageRank失效 — 由于互联网的持续扩展,链接结构稀释、SEO操纵、AIGC冲击、语义价值维度缺失等导致互联网早期的PageRank等策略很难有效过滤高价值内容。
3. 数据价值定义的范式转变 — 从"点击满意度+链接权威性"转向"知识密度+信息增益+事实准确性+语义多样性",对于内容价值的评估也有很大的不同。
4. 业界进展分析 — 引用了2024-2025年的一些关键工作:
○ DataComp-LM(斯坦福/苹果等23所机构,2024)— 首个系统验证"数据筛选策略决定模型性能"的基准
○ Ultra-FineWeb(清华等,2025.5)— 高效数据过滤流水线,构建1万亿英文+1200亿中文高质量语料
○ CNCC 2025 LLM数据处理Tutorial — 领域权威会议将数据质量列为核心研究方向
因此构建全网理解和特征研究对于建设大模型语料和RAG索引数据都是非常重要的研究工作。
岗位要求
研究领域:
-目前正在攻读计算机科学或相关STEM领域的学士,硕士或博士学位
-具有一种或多种通用编程语言的经验,包括但不限于: Java,C/C ++ 、Python、JavaScript或Go
-具有上述研究领域的相关经验,包括行业经验或作为参与实验室研究
优先录用:
-对技术研究充满热情,具有产生新思想和创新的能力; 在自学,问题分析和解决方面表现出色
-在国际会议上或核心期刊发表一份或多份出版物或论文
-至少3个月的全职工作