编程基础篇 · 查找与排序

排序在 AI 里的真身:Rerank

上一课的排序比的是数字大小,但 AI 世界里排的是「相关性」:RAG 从知识库捞回来一堆段落,谁排前面谁就能挤进上下文——排错了,模型就会一本正经地引用错误资料。这个「打分 + 重排」的环节叫 Rerank。今天你亲自上岗,当一次 Rerank 模型。

交互 · 亲手当一次 Rerank 模型

场景:用户在客服机器人里问「你们的退货政策是什么?」,粗排从知识库捞回 5 条候选段落。每条有三项分数:向量相似度(意思相近)、关键词命中(字面匹配)、新鲜度(文档新旧)。你手里有三个权重滑块,总分 = 三项分数加权平均。留意:初始只重相似度,排第一的其实是 2023 年的旧版政策——试试加大「新鲜度」权重,看正确条款怎么登顶。

💬 你们的退货政策是什么? 粗排召回 5 条候选
核心概念 · 两阶段漏斗

你刚才干的活,在真实系统里是「精排」——漏斗的最后一层。完整的流程长这样(滚到这里自动播放):

0
知识库全部文档
粗排:向量近邻,快而糙
0
条候选段落
精排 Rerank:逐条细看,贵而准
0
条最终塞进上下文
为什么不全用精排?

贵。精排要把「问题 + 段落」成对送进模型逐条细读,100 万条都这么读,等一小时、烧一笔钱。所以先用便宜的粗排把 100 万砍到 50。

为什么不全用粗排?

不准。粗排只看向量距离,分不清「现行政策」和「旧版政策」——你刚才亲眼见过。所以最后 50 条要请贵的模型逐条把关。

工程 = 在漏斗每层花对钱。快而糙的算法负责海选,贵而准的模型负责决赛——两阶段各干各的,总成本和总质量才能同时达标。这个「分层花钱」的思路,你以后在缓存、推荐、审核系统里会反复见到。
举一反三 · 全是「先捞后排」
🔍

搜索结果排序

搜索引擎先从万亿网页里粗召回,再按相关性、权威度、新鲜度打分精排——你看到的第一页,就是 Rerank 的产出。

📱

推荐信息流

短视频先粗筛几千条候选,再用精排模型预测「你会不会看完」逐条打分。你的首页顺序,每天被重排几十次。

📚

RAG 检索

就是今天的主场:向量近邻粗捞、Rerank 精选,最后几条才有资格占用宝贵的上下文——上一章 O(n²) 的账单还记得吧。

✅ 这一课想和你分享的