权重是什么?一个模型的全部本事
新闻里天天说「某某模型开源了」。开源的到底是什么东西?是代码吗?其实主要是一个文件:权重。搞清楚它是什么,后面所有关于开源的争论你都能自己判断。
模型内部没有规则、没有知识库、没有 if-else。有的只是一个巨大的数字表格。下面这些格子里的每个数,就是一个权重,颜色深浅表示它的绝对值大小。
上面是 36 个数。一个 Qwen3-8B 模型有 80 亿个这样的数。训练的全部意义,就是把这几十亿个数从随机值一点点调整到合适的值。调完了,参数冻结,模型就定型了。
每个权重占多少字节,取决于存储精度。模型发布时通常用 FP16,也就是每个数占 2 个字节。所以文件体积有一个很好记的估算:
80 亿参数 × 2 字节 = 160 亿字节 ≈ 16 GB
公式记住了,但它到底意味着什么,拖一下就知道了。下面这个滑块从 0.5B 拖到 2.4 万亿,你可以顺手切换存储精度,看同一个模型的文件是怎么胀大和缩小的。
下面用一组真实的模型对比一下。这里选 Qwen 系列做尺子,是因为它的尺寸谱系目前最完整,从 0.6B 一直到 2.4T 都有公开型号,同一个系列内部比较不会掺进架构差异的干扰。
存储体积和运行时占用是两码事。文件 16 GB,不代表 16 GB 显存就能跑起来。模型运行时还要额外开销一块地方存放对话的中间状态,也就是第二篇章讲过的 KV Cache。算下来通常要在参数量的基础上多留三到五成。
这一章最后有一页交互工具,你可以直接选自己的显卡或者 Mac 型号,看能跑哪些模型。这里先记住结论:看文件大小估显存,会低估。
把上面的事情串起来,权重的意义就清楚了。它不只是一个文件,它是控制权。
反过来说,只提供 API 的模型,你租的是使用权。价格、可用性、什么时候下线,都由对方决定。这个区别在做技术选型时会直接变成风险,也是下一节要拆的东西:各家嘴里的「开源」,含义差得非常远。