开源专题 · 大模型如何变小

蒸馏的代价:模型正在变得越来越像

上一节说蒸馏是让学生学老师。问题在于,学生学到的是老师的全部:本事、口癖、偏见、甚至对自己身份的认知。当整个行业都在向少数几个老师学习,结果就是大家越来越像。

先看研究怎么说
Generative Monoculture in Large Language Models
Wu & Black · arXiv:2407.02209 · 2024
研究发现,多个模型基于相同底座蒸馏之后,输出的多样性显著下降。在书评撰写、代码生成这类本该有很多种合理答案的任务上,不同模型给出的结果高度趋同。作者用「单一文化」形容这个状态。
Measuring and Understanding LLM Identity Confusion
Xu et al. · arXiv:2411.10683 · 2024-11
研究覆盖 27 个模型,发现其中 25.93% 存在身份混淆:被问到「你是谁」时,错误地声称自己是另一个模型。作者还指出,这类错误对用户信任的伤害,比一般的逻辑错误更大。
两篇论文均可在 arXiv 公开检索,编号如上。核对日期 2026-08-07。
行业里公开的争议

蒸馏别人家的模型是否越界,目前没有共识,但已经有公开的指控。

Anthropic 曾公开表示,发现有厂商对 Claude 进行「工业级规模」的蒸馏。OpenAI 也曾指控 DeepSeek 通过蒸馏 GPT 系列获取能力。这些都是一方的指控,被指控方并未承认,也没有第三方机构给出裁定。放在这里是为了说明一件事:这个领域的边界还在形成中,各家的服务条款大多禁止用自家输出去训练竞品,但技术上很难取证。

依据 Anthropic 公开声明及路透社等媒体报道。此处仅陈述争议存在,不对指控本身作事实认定。核对日期 2026-08-07。
你自己就能观察到的三个症状
症状 1

口癖被整批继承

某些句式在一个头部模型上高频出现,之后就在大量模型里同时冒出来,成了识别 AI 写作的指纹。

典型句式 「这不仅仅是技术问题,更是一个产品问题」
「让我们深入探讨一下这个话题」
值得注意的是,这里有几个关键点」
症状 2

格式怪癖被继承

有的模型习惯在中文里给名词补上英文标注,学它的模型也跟着这么写,哪怕场景完全不需要。

典型输出 「这个概念(Concept)非常重要,我们需要关注性能(Performance)和安全性(Safety)」
症状 3

连身份都学过去了

最直白的一种。问一个模型它是谁,它报出的可能是老师的名字。

对话 用户:你是哪个模型?
模型:我是 ChatGPT,由 OpenAI 开发…(实际上它是另一家公司的产品)
这些不是 bug,是蒸馏的必然结果。训练数据是老师的输出,老师怎么说话,学生就怎么说话。你没法只继承能力而不继承习惯,因为在训练数据里,这两样东西根本分不开。
生态越集中,这个问题越明显

这一章前面提到过,某个开源系列的衍生模型数量已经超过 20 万个。从生态角度看这是影响力的证明,但换个角度看,它同时意味着 20 万个模型共享同一批底层假设

底座模型里的偏见、知识盲区、表达倾向,会沿着蒸馏链条一层层传下去。上游改一个训练策略,下游几万个模型跟着变。这种结构在软件工程里有个熟悉的名字:单点依赖。

对产品最直接的影响:多模型交叉验证可能是假的。很多团队会同时调用两三个不同厂商的模型,让它们互相校验来降低出错概率。这套做法成立的前提是它们会犯不同的错。如果这几个模型的血缘上溯到同一个老师,它们很可能在同一个地方一起错,而且错得一模一样。此时交叉验证给你的不是安全感,是虚假的安全感。

这话听着像杞人忧天,直到你自己试一次。下面是六个来自不同公司的产品,名字、厂商、宣传都不一样。

能做什么
1

选型时查一下血缘

模型卡里通常会写明底座是什么。做多模型冗余设计时,优先选底座不同的组合,而不是只看厂商名字不同。

2

产品差异化别建在模型层

如果你的竞争力来自「我们的回答质量更好」,而大家用的模型血缘相近,这个优势不牢固。真正的差异通常来自数据、工作流和对场景的理解。

3

把口癖当成需要治理的问题

如果你的产品有品牌调性要求,默认输出大概率会带着上游的表达习惯。这要靠提示词约束和后处理去改,指望换个模型解决通常没用,因为它们都这样。

这一章前半段讲清楚了开源是什么、模型怎么变小、代价在哪里。接下来两节动手:先算清楚你的机器能跑多大的模型,再把它真正跑起来。