开源专题 · 大模型如何变小

为什么要把模型做小:蒸馏的动机

上一节刚讲完,模型越大,能力越容易涌现。那为什么整个行业还在拼命把模型做小?因为能力不是唯一的约束条件。成本、延迟、数据能不能出门,这三件事会在真实项目里直接把旗舰模型挡在门外。

先说结论
把模型做小,是被现实逼出来的。旗舰模型能力最强,但它贵、它慢,而且必须把数据发到别人的服务器上。很多场景里,一个能力够用的小模型才是唯一能落地的选项。蒸馏,就是把小模型的能力尽量补上来的那个手段。
三个把模型往小里做的理由

成本差的是数量级,不是几成

参数量小一个量级,一次推理要动用的算力通常也小一个量级。行业里的常见口径是,小模型的推理成本可以比旗舰模型低一到两个数量级。具体差多少,取决于尺寸、量化档位、批量大小和部署方式。别记死数字,记住这是量级上的差距,不是打个折。

速度本地跑省掉整段网络往返

调用远端旗舰模型,要走一次网络往返,还要排队,然后逐字生成。等上几秒是常态。本地跑的小模型省掉了网络这一段,首字出来得快得多。对话类产品对这一段特别敏感,用户等三秒和等零点三秒,是两种体验。

私有化与合规有些数据根本不允许出内网

病历、卷宗、内部代码、未公开的财务数据,这类内容的合规要求是不出内网。这时候对面的模型能力再强也用不上,因为第一步就过不去。本地部署的小模型是唯一一条路。第一节讲权重时说的那个控制权,在这里变成了硬约束。

「差一到两个数量级」这句话,换算成月底那张账单是多少?把你产品的请求量拖进去看看。

先拖到你自己产品的量级,再看两条账单的差距。
每日请求
上述成本与延迟均为量级描述,不是基准测试结果。上面这个换算器用的单价与延迟同样是量级示意,不构成任何厂商的报价。实际差距取决于模型尺寸、量化档位、批量大小与部署方式,请以自己场景下的实测为准。核对日期 2026-08-07。
小到什么程度,才装得进自己的机器

「小」是个相对的说法,但判断标准很具体:能不能塞进手上这块显卡。本章后面有一页交互工具专门算这件事,这里先把公式给出来。

显存(GB)≈ 参数量(B)× 精度系数
FP16 取 2.6,INT4 取 0.65。系数里已经含了 KV Cache 这类运行时开销,不要在外面再乘一次。

按这个口径算几个尺寸。最后一列是 INT4 量化之后,在一块 24 GB 的消费级显卡上能不能跑。

Qwen3-0.6B
FP16 1.6 GB
INT4 0.4 GB
轻松,端侧设备也带得动
Qwen3-8B
FP16 20.8 GB
INT4 5.2 GB
很宽裕,8 GB 卡也能跑
Qwen3-32B
FP16 83.2 GB
INT4 20.8 GB
勉强,上下文一长就会溢出
Qwen3-235B-A22B
FP16 611 GB
INT4 152.8 GB
跑不动,不是量化能解决的
换算系数与本章 oss-8 的显存计算器一致:FP16 为 2.6,INT4 为 0.65,系数中已包含约三到五成的运行时开销。这是经验估算值,不是厂商标称值。MoE 模型的显存按总参数量算,激活参数量只影响速度。判定时留了约 15% 余量,所以 20.8 GB 在 24 GB 卡上算「勉强」而不算「可以」。核对日期 2026-08-07。

结论很直白。8B 这个尺寸量化之后,一块几年前的游戏显卡就跑得动;旗舰尺寸不管怎么量化都进不去。于是问题变成了另一个:小尺寸的能力,能不能补上来。

蒸馏:让大模型去教小模型

补能力有两条路。一条是让小模型自己从头学,数据、算力、试错全部重来一遍。另一条是找一个已经学会的大模型来教它。后一条就是知识蒸馏。

大模型当老师,小模型当学生。老师把自己面对一个问题时的判断方式演示出来,学生照着学。学生不用从零开始摸索,也不用长成老师那个身板。

这跟传统训练的差别,主要在一次能传过去多少信息。

传统训练:只知道对不对

训练数据给的是标准答案。答对了加分,答错了扣分。一道题传回来的信息基本就是一个「对」或者「错」。至于错得离谱还是只差一点,标签里看不出来。信息很稀疏,所以要靠海量数据和海量算力去堆。

蒸馏:还知道老师怎么想

老师给出的不只是最终那个答案,还有它在各个候选之间的倾向。同一道题,学生能看到老师觉得哪些选项接近、哪些完全不沾边。同样一条数据,携带的信息量大得多,学生学起来也就快得多。

这份信息具体怎么传过去、训练的时候怎么算,下一节 oss-6 会拆开讲。这一节只要记住动机:蒸馏省的是钱和时间,它不创造新能力。

一个可以自己去查的案例

2025 年 1 月 20 日,DeepSeek 发布 R1,同时开源了一批蒸馏版小模型。做法是用 R1 生成推理数据,再拿这批数据去训练更小的模型。这批蒸馏版里,有的以 Llama 为底座,有的以 Qwen 为底座。

这件事值得记一下,因为它是一次公开可查的第三方选择。一家公司做蒸馏时挑了哪些底座,比任何宣传口径都更能说明问题。R1 采用 MIT License,官方公告里明确写了允许通过蒸馏训练其他模型。这句话白纸黑字写出来,别人才敢把这条路走通。

来源:DeepSeek 官方公告,2025-01-20。R1 采用 MIT License,公告中明确允许用户通过蒸馏训练其他模型。同批发布的蒸馏模型覆盖 1.5B 到 70B 多个尺寸,底座分别取自 Qwen 与 Llama 两个系列,各版本仍需遵循其底座模型自身的许可条款。核对日期 2026-08-07。

这批模型的命名规则和具体做法,下一节展开。

先把丑话说在前面
蒸馏不是万能的。在需要长链条推理、多步规划、跨大量上下文做取舍的任务上,小模型仍然显著弱于旗舰模型。这类差距不会因为换个更强的老师就消失。做选型时别指望一个 7B 模型接管所有场景,先把任务拆开,看清楚哪些环节真的用得上小模型。
学生会连老师的毛病一起学过去。老师的偏见、知识盲区、表达习惯,学生都会继承,而且自己分辨不出来。当大量小模型都从同一批老师那里学,整个生态会朝同一个方向漂。这个副作用是 oss-7 要专门讲的。
这一节带走什么
一、把模型做小的动因是成本、延迟、数据合规这三条现实约束,跟追求能力上限无关。
二、能不能落地,先看显存这个硬指标,公式是参数量乘精度系数。
三、蒸馏是让大模型教小模型,目的是省掉从零训练的成本。
四、小模型有能力天花板,也会继承老师的缺陷。这两点在选型时要先摆到台面上。

下一节看蒸馏具体怎么做:老师怎么出题,学生怎么对答案,中间有哪些工程上的坑。