为什么要把模型做小:蒸馏的动机
上一节刚讲完,模型越大,能力越容易涌现。那为什么整个行业还在拼命把模型做小?因为能力不是唯一的约束条件。成本、延迟、数据能不能出门,这三件事会在真实项目里直接把旗舰模型挡在门外。
成本差的是数量级,不是几成
参数量小一个量级,一次推理要动用的算力通常也小一个量级。行业里的常见口径是,小模型的推理成本可以比旗舰模型低一到两个数量级。具体差多少,取决于尺寸、量化档位、批量大小和部署方式。别记死数字,记住这是量级上的差距,不是打个折。
速度本地跑省掉整段网络往返
调用远端旗舰模型,要走一次网络往返,还要排队,然后逐字生成。等上几秒是常态。本地跑的小模型省掉了网络这一段,首字出来得快得多。对话类产品对这一段特别敏感,用户等三秒和等零点三秒,是两种体验。
私有化与合规有些数据根本不允许出内网
病历、卷宗、内部代码、未公开的财务数据,这类内容的合规要求是不出内网。这时候对面的模型能力再强也用不上,因为第一步就过不去。本地部署的小模型是唯一一条路。第一节讲权重时说的那个控制权,在这里变成了硬约束。
「差一到两个数量级」这句话,换算成月底那张账单是多少?把你产品的请求量拖进去看看。
「小」是个相对的说法,但判断标准很具体:能不能塞进手上这块显卡。本章后面有一页交互工具专门算这件事,这里先把公式给出来。
FP16 取 2.6,INT4 取 0.65。系数里已经含了 KV Cache 这类运行时开销,不要在外面再乘一次。
按这个口径算几个尺寸。最后一列是 INT4 量化之后,在一块 24 GB 的消费级显卡上能不能跑。
结论很直白。8B 这个尺寸量化之后,一块几年前的游戏显卡就跑得动;旗舰尺寸不管怎么量化都进不去。于是问题变成了另一个:小尺寸的能力,能不能补上来。
补能力有两条路。一条是让小模型自己从头学,数据、算力、试错全部重来一遍。另一条是找一个已经学会的大模型来教它。后一条就是知识蒸馏。
这跟传统训练的差别,主要在一次能传过去多少信息。
训练数据给的是标准答案。答对了加分,答错了扣分。一道题传回来的信息基本就是一个「对」或者「错」。至于错得离谱还是只差一点,标签里看不出来。信息很稀疏,所以要靠海量数据和海量算力去堆。
老师给出的不只是最终那个答案,还有它在各个候选之间的倾向。同一道题,学生能看到老师觉得哪些选项接近、哪些完全不沾边。同样一条数据,携带的信息量大得多,学生学起来也就快得多。
这份信息具体怎么传过去、训练的时候怎么算,下一节 oss-6 会拆开讲。这一节只要记住动机:蒸馏省的是钱和时间,它不创造新能力。
2025 年 1 月 20 日,DeepSeek 发布 R1,同时开源了一批蒸馏版小模型。做法是用 R1 生成推理数据,再拿这批数据去训练更小的模型。这批蒸馏版里,有的以 Llama 为底座,有的以 Qwen 为底座。
这件事值得记一下,因为它是一次公开可查的第三方选择。一家公司做蒸馏时挑了哪些底座,比任何宣传口径都更能说明问题。R1 采用 MIT License,官方公告里明确写了允许通过蒸馏训练其他模型。这句话白纸黑字写出来,别人才敢把这条路走通。
这批模型的命名规则和具体做法,下一节展开。
二、能不能落地,先看显存这个硬指标,公式是参数量乘精度系数。
三、蒸馏是让大模型教小模型,目的是省掉从零训练的成本。
四、小模型有能力天花板,也会继承老师的缺陷。这两点在选型时要先摆到台面上。
下一节看蒸馏具体怎么做:老师怎么出题,学生怎么对答案,中间有哪些工程上的坑。