零基础入门 · 小白三千问
『跑分第一』的模型,为什么用起来不行?
刷到「新模型霸榜」的新闻,兴冲冲换过去,结果写个周报还没原来的顺手。你没用错,榜单也没造假,只是榜单测的和你要的,从来就没对齐过。
一句话回答
榜单测的是考试,你要的是干活。题库会被刷、考纲未必含你的场景,跑分当参考就好。选模型最靠谱的办法是拿自己的活儿去试。
反转演示 · 高分选手输给了谁
下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急,点下面三个真实任务,看看它们各自的表现。
模型 A
95 分榜单排名靠前,新闻里的常客
模型 B
88 分榜单成绩平平,无人报道
三个任务试完了。结论呼之欲出:95 分和 88 分的差距,在你的日常任务里可能根本感觉不到,甚至反过来。分数排的是考场座次,干活好坏还得上手试。
为什么会这样 · 三个原因
刷榜
榜单题库在网上流传久了,难免混进模型的训练数据。相当于考前背了答案:分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」。
过拟合考试
厂商知道大家看榜,就专门朝着考点优化。就像应试教育里的做题家:卷面成绩顶尖,日常交流和动手能力反而可能被牺牲掉。
考纲不含你的场景
榜单考数学、考代码、考知识问答,但不考「懂你们行业」,也不考「安慰人」。你最在意的那门课,考纲里可能压根没有。
什么榜相对可信 · 认准真人盲测
也有相对可信的榜:真人盲测投票类。做法是把两个模型的回答摆在一起,隐藏名字,让大量真实用户投票选哪个更好。这种榜没有固定题库可背,考官是活人,刷起来难度大得多。
但它也只是「相对」可信:投票的人未必和你干同一行,大众觉得好的回答风格,未必适合你的场景。想看国产模型在各种真实场景里的实际表现,可以移步国产模型怎么选那一页。
自己怎么选 · 建一套私人题库
最靠谱的评测机构是你自己。方法很土,但极其有效:从自己的工作里攒 10 个真实问题,存成一个文档。每次想换模型,把 10 道题跑一遍,好不好用一目了然。
私人题库的攒法(示例)
- 挑最常干的活:周报、方案、邮件,选你每周都要做的 3 件
- 挑最专业的活:带上行业黑话和内部语境的问题,考它懂不懂你这行
- 挑翻过车的活:以前 AI 答砸过的问题,最能试出新模型的成色
- 留一道送分题再留一道刁钻题:送分题都答不好的直接淘汰,刁钻题用来拉开差距
- 答案好坏你说了算:你比任何榜单都清楚,什么样的输出算「能交差」
这套题库还有个隐藏好处:它会逼你想清楚自己到底需要 AI 干什么。很多人换了三个月模型,最后发现真正的问题是提示词没写好。题库在手,换模型五分钟出结论,再也不用追着新闻跑。
✅ 这一页想和你分享的
- 跑分是入学考试,你要的是试用期表现:两件事相关,但相关得有限
- 高分可能是背过题:题库会泄漏进训练数据,考点会被针对性优化
- 真人盲测投票的榜相对可信:没有固定题库,考官是活人
- 建一套自己的十题小考卷:换模型跑一遍,五分钟出结论,比追新闻管用