零基础入门 · 小白三千问

『跑分第一』的模型,为什么用起来不行?

刷到「新模型霸榜」的新闻,兴冲冲换过去,结果写个周报还没原来的顺手。你没用错,榜单也没造假,只是榜单测的和你要的,从来就没对齐过

一句话回答

榜单测的是考试,你要的是干活。题库会被刷、考纲未必含你的场景,跑分当参考就好。选模型最靠谱的办法是拿自己的活儿去试

反转演示 · 高分选手输给了谁

下面是两个虚构的模型:A 跑分 95,B 跑分 88,按榜单选肯定选 A。但是别急,点下面三个真实任务,看看它们各自的表现。

模型 A

95 分
榜单排名靠前,新闻里的常客

模型 B

88 分
榜单成绩平平,无人报道
三个任务试完了。结论呼之欲出:95 分和 88 分的差距,在你的日常任务里可能根本感觉不到,甚至反过来。分数排的是考场座次,干活好坏还得上手试。
为什么会这样 · 三个原因
📖

刷榜

榜单题库在网上流传久了,难免混进模型的训练数据。相当于考前背了答案:分数很好看,能力没那么多。这在圈内有个体面的说法,叫「数据污染」。

🎯

过拟合考试

厂商知道大家看榜,就专门朝着考点优化。就像应试教育里的做题家:卷面成绩顶尖,日常交流和动手能力反而可能被牺牲掉。

🗺️

考纲不含你的场景

榜单考数学、考代码、考知识问答,但不考「懂你们行业」,也不考「安慰人」。你最在意的那门课,考纲里可能压根没有。

什么榜相对可信 · 认准真人盲测

也有相对可信的榜:真人盲测投票类。做法是把两个模型的回答摆在一起,隐藏名字,让大量真实用户投票选哪个更好。这种榜没有固定题库可背,考官是活人,刷起来难度大得多。

但它也只是「相对」可信:投票的人未必和你干同一行,大众觉得好的回答风格,未必适合你的场景。想看国产模型在各种真实场景里的实际表现,可以移步国产模型怎么选那一页。

自己怎么选 · 建一套私人题库

最靠谱的评测机构是你自己。方法很土,但极其有效:从自己的工作里攒 10 个真实问题,存成一个文档。每次想换模型,把 10 道题跑一遍,好不好用一目了然。

私人题库的攒法(示例)

这套题库还有个隐藏好处:它会逼你想清楚自己到底需要 AI 干什么。很多人换了三个月模型,最后发现真正的问题是提示词没写好。题库在手,换模型五分钟出结论,再也不用追着新闻跑。

✅ 这一页想和你分享的