开源专题 · 在自己的机器上跑起来

你的电脑能跑多大的模型

前面讲的都是概念,这一节动手。选一下你的显卡或者 Mac 型号,直接看结论。看完你会发现,本地跑模型的门槛比大多数人想的低。

先算一次
平台
型号
精度
候选模型均为实际可下载的 Apache 2.0 权重。换算为估算值,用途是帮你判断可行性,不能替代实测。

最后一行的 Qwen3.8-Max 无论你怎么选都是红的,这不是列表出错。它是本章第三节讲过的那个首次开放权重的旗舰,2.4 万亿参数按上面的公式算下来要 1560 GB,把设备换成列表里最贵的那台也不够。把它留在列表里,是因为「权重开放」和「你跑得动」是两件事,看到这个数字比读一句「模型很大」有用。

公式是怎么来的

上面的结论不是查表查出来的,就一个乘法:

需要的显存(GB)≈ 参数量(B)× 精度系数
举例:8B 模型跑 INT4,8 × 0.65 ≈ 5.2 GB

需要解释的是这个系数。单纯装载权重的话,INT4 每个参数占 0.5 字节,8B 模型只要 4 GB。但模型跑起来还要额外一块地方,用来存放对话过程中积累的中间状态,也就是第二篇章讲过的 KV Cache。系数里已经含了这部分开销,所以不要在外面再乘一次余量,否则会算出没有机器跑得动的结论。

四个精度档位

量化就是用更少的位数去存每个参数。位数越少体积越小,代价是精度损失。

FP32
× 4.0
全精度。基本只在训练时用,本地推理没人这么跑。
FP16
× 2.6
半精度。模型发布时的原始格式,质量的基准线。
INT8
× 1.3
体积减半,质量损失通常察觉不到。显存够的话是个稳妥选择。
INT4
× 0.65
体积只有原来的四分之一。多数日常任务上感受得到但可接受。
本地跑最常用

你可以在上面的计算器里把精度从 FP16 切到 INT4,看能跑的型号变化。量化是把本地部署门槛拉低最有效的一招,一张 8 GB 的显卡跑不动 FP16 的 8B 模型,换成 INT4 就轻松了。

量化的损失不是均匀分布的。日常问答、总结、改写这类任务上 INT4 基本够用,但在需要长链条推理、精确计算的任务上,掉分会明显一些。要求高的场景,宁可选小一号的模型跑 INT8,也别选大一号的跑 INT4。
两种硬件,两套逻辑

NVIDIA 显卡

  • 显存独占,标称多少基本就能用多少
  • 带宽高,生成速度快,同尺寸模型体感明显更流畅
  • 容量是硬上限,消费级卡目前顶到 32 GB 左右
  • 软件生态最成熟,遇到问题基本都能搜到解法

Apple Silicon

  • CPU 与 GPU 共享统一内存,系统不允许全部划给 GPU
  • 计算器里按可分配的约 75% 折算,这是保守估计
  • 容量优势大,高配机型能装下消费级显卡碰不到的尺寸
  • 带宽通常不及同价位独显,大模型上生成速度会慢一些

简单说:NVIDIA 拼速度,Apple 拼容量。如果你想跑 30B 以上的模型,一台大内存的 Mac 往往比消费级显卡更现实;如果追求响应速度,独显更合适。

统一内存的 GPU 可用比例在 macOS 上可通过 iogpu.wired_limit_max 调整,75% 是默认情况下的保守估计,不是硬上限。
MoE 模型的特殊之处

结果列表里带 A 字样的是 MoE 模型,比如 Qwen3-30B-A3B,意思是总参数 30B、每次实际激活 3B。这类模型有个容易踩的坑:

显存按总参数算,速度按激活参数算。30B 的 MoE 模型你得准备装下 30B 的显存,但它跑起来的速度接近 3B。占地方大,跑得快。

这意味着 MoE 特别适合显存充裕但希望响应快的场景,比如大内存的 Mac。反过来,如果显存紧张,同样占用下选一个稠密的小模型更划算。

几条免责说明

上面所有数字都是估算,实际占用还会受这几个因素影响:

所以计算器给的是可行性判断,不是精确预算。结论是「勉强」的时候,就当作跑不动来准备。

下一步

知道能跑什么之后,下一节把它真正装起来。两个工具,命令行的 Ollama 和图形界面的 LM Studio,十分钟能跑通。