先说结论
能力随参数量的增长,很多时候并不平滑。 有一类任务,模型在很宽的规模区间里成绩一直贴着零,看上去毫无进展。等参数量跨过某个位置,成绩在很短的区间内跳到可用水平。跳升之前,你从已有的数据点看不出后面会发生什么。
两条曲线,形状完全不同
把参数量放在横轴,某项任务的成绩放在纵轴,会看到两种走势。一种随规模稳步抬升,每加一倍参数就多拿一点分。另一种在很长一段区间里贴着地面,然后在某个位置突然抬头。
常规能力,随规模稳步抬升
涌现能力,跨过阈值后跳升
上图为示意,横轴与纵轴的取值不对应任何具体模型或评测集。现象与曲线形态参考 Wei et al., Emergent Abilities of Large Language Models, TMLR 2022(arXiv:2206.07682)。
麻烦的地方在左半段。跳升发生之前,这条曲线和「这条路走不通」看起来一模一样。手里只有前半段数据的时候,没有办法外推出后面会不会抬头,也没有办法预测抬头的位置。目前也没有一套理论能提前算出某项能力会在哪个规模出现。
这件事读起来平淡,拖一遍才有感觉。下面把模型规模交给你,从 0.5B 一路往上推,看六项能力是怎么一项一项亮起来的。
从最小拖到最大,注意灯不是一起亮的,是一项一项蹦出来的。
上面的阈值为量级示意,取自公开研究与行业讨论中被反复引用的观察,不是精确测量值。换架构、换训练数据或换评测方式,这些位置都会明显偏移。
六个被反复提到的例子
下面这些能力都在公开研究和行业讨论里被当作涌现的例子。括号里的规模只是量级参考。同一项能力换个架构、换批训练数据、换种评测方式,位置就会明显偏移。
单步算术小模型也能做对一部分。要求它连着推好几步再给答案,小模型的正确率长期贴着零。
约 10B 量级
在英文语料上学会的推理方式,能用到训练里出现得很少的语种上。规模不够的时候,换个语种成绩就崩。
约 7B 量级
稳定吐出合法 JSON,按函数签名填对参数类型。这项能力没有被专门设计进去,是训练完之后发现它有的。
约 7B 量级
让模型先写出推理过程再给答案。这招在小模型上拿不到收益,有时还会把原本能答对的题带偏。
约 100B 量级
判断对话里的另一个人掌握了哪些信息、会怎么想。这一项的争议最大,有研究把测试题改写几个字,能力就消失了。
争议中
几十轮之后仍然守住设定好的身份、语气和边界,中途不跑偏,也不被用户几句话带走。
约 13B 量级
思维链在约 100B 规模才出现明显收益,见 Wei et al., Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, NeurIPS 2022(arXiv:2201.11903)。理论心智的相关报告见 Kosinski, arXiv:2302.02083(2023);同期 Ullman, arXiv:2302.08399 指出对任务做微小改写后该表现即消失。其余各项的参数量为量级参考,行业内没有统一的权威阈值,请勿当作精确数字引用。核对日期 2026-08-07。
这件事在学术上还没有定论
有一派研究认为,相当一部分「涌现」是评测指标造出来的假象。 换一种打分方式,同一批模型在同一批题目上画出来的曲线会变成平滑上升。
论证是这样的。多步数学题通常按「答案完全正确」判分,中间错一步,整题算零。这种打分方式是离散的,它把模型的连续进步压成了一个二值结果。模型从错得离谱进步到只差最后一点,分数照样是零。等它跨过最后那点门槛,分数才一次性从零跳起来。
把判分换成连续指标,比如逐个 token 看正确答案的对数概率,同一组实验的曲线就变成一条平滑上升的线。跳变消失了,说明跳变来自尺子,模型本身一直在稳步变好。
离散指标
一次通过才算分。中间的进步全部记为零,最后集中兑现,看上去就是一次跳升。
连续指标
给部分正确也记分。同一批模型的进步被完整记录下来,曲线变成平滑上升。
Schaeffer, Miranda & Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023(arXiv:2304.15004)。该文主张涌现在很大程度上由研究者选择的评测指标引发,采用非线性或离散指标时出现跳变,改用线性、连续指标后曲线平滑。上面两张迷你图为原理示意,未取自原文数据。核对日期 2026-08-07。
这个反驳没有把现象整个推翻。它说明的是一件更具体的事:看到一条阶跃曲线时,先确认阶跃来自模型,还是来自你的尺子。对做产品的人来说,这个提醒比争论本身有用。你的验收标准如果是「一次跑通才算过」,那你在自己的数据上大概率也会看到阶跃。
对做产品的人意味着什么
1
换更大的模型之前,先自己测一遍
跑分榜测的是通用任务,你的场景可能正好卡在某个阈值附近。换一档规模也许立刻就通了,也许毫无变化。花半天做一个二三十条样本的小测试集,用真实数据跑一遍,比读十篇评测有用。
2
小模型做不到的事,别急着用提示词硬凑
遇到怎么改提示词都做不对的任务,先换一档规模试试。如果大一档立刻就对了,那之前那些复杂提示词只是在补规模的缺口。这类提示词通常又长又脆,换个模型、换个版本就失效。
3
看到「突然会了」,也别急着下结论
上面那个争议在自己的测试里同样成立。加一个宽松一点的判分口径做交叉验证,比如按步骤给分、按字段给分。两把尺子都显示跳升,这个结论才站得住。
一句话记住: 规模是一个自变量,值得单独测。它可能给你带来没预期过的能力,也可能什么都不给。这件事只有在你自己的任务上才能问出答案。
接下来
涌现说明规模能换来能力。它同时留下一个问题:既然大模型更强,为什么整个行业还在拼命把模型做小?把几百 B 压到几 B,损失掉的正是这一节讲的这部分东西。压缩的收益是什么,代价能不能接受,下一节从这个矛盾开始讲。