蒸馏的代价:模型正在变得越来越像
上一节说蒸馏是让学生学老师。问题在于,学生学到的是老师的全部:本事、口癖、偏见、甚至对自己身份的认知。当整个行业都在向少数几个老师学习,结果就是大家越来越像。
蒸馏别人家的模型是否越界,目前没有共识,但已经有公开的指控。
Anthropic 曾公开表示,发现有厂商对 Claude 进行「工业级规模」的蒸馏。OpenAI 也曾指控 DeepSeek 通过蒸馏 GPT 系列获取能力。这些都是一方的指控,被指控方并未承认,也没有第三方机构给出裁定。放在这里是为了说明一件事:这个领域的边界还在形成中,各家的服务条款大多禁止用自家输出去训练竞品,但技术上很难取证。
口癖被整批继承
某些句式在一个头部模型上高频出现,之后就在大量模型里同时冒出来,成了识别 AI 写作的指纹。
「让我们深入探讨一下这个话题」
「值得注意的是,这里有几个关键点」
格式怪癖被继承
有的模型习惯在中文里给名词补上英文标注,学它的模型也跟着这么写,哪怕场景完全不需要。
连身份都学过去了
最直白的一种。问一个模型它是谁,它报出的可能是老师的名字。
模型:我是 ChatGPT,由 OpenAI 开发…(实际上它是另一家公司的产品)
这一章前面提到过,某个开源系列的衍生模型数量已经超过 20 万个。从生态角度看这是影响力的证明,但换个角度看,它同时意味着 20 万个模型共享同一批底层假设。
底座模型里的偏见、知识盲区、表达倾向,会沿着蒸馏链条一层层传下去。上游改一个训练策略,下游几万个模型跟着变。这种结构在软件工程里有个熟悉的名字:单点依赖。
这话听着像杞人忧天,直到你自己试一次。下面是六个来自不同公司的产品,名字、厂商、宣传都不一样。
选型时查一下血缘
模型卡里通常会写明底座是什么。做多模型冗余设计时,优先选底座不同的组合,而不是只看厂商名字不同。
产品差异化别建在模型层
如果你的竞争力来自「我们的回答质量更好」,而大家用的模型血缘相近,这个优势不牢固。真正的差异通常来自数据、工作流和对场景的理解。
把口癖当成需要治理的问题
如果你的产品有品牌调性要求,默认输出大概率会带着上游的表达习惯。这要靠提示词约束和后处理去改,指望换个模型解决通常没用,因为它们都这样。
这一章前半段讲清楚了开源是什么、模型怎么变小、代价在哪里。接下来两节动手:先算清楚你的机器能跑多大的模型,再把它真正跑起来。