你的电脑能跑多大的模型
前面讲的都是概念,这一节动手。选一下你的显卡或者 Mac 型号,直接看结论。看完你会发现,本地跑模型的门槛比大多数人想的低。
最后一行的 Qwen3.8-Max 无论你怎么选都是红的,这不是列表出错。它是本章第三节讲过的那个首次开放权重的旗舰,2.4 万亿参数按上面的公式算下来要 1560 GB,把设备换成列表里最贵的那台也不够。把它留在列表里,是因为「权重开放」和「你跑得动」是两件事,看到这个数字比读一句「模型很大」有用。
上面的结论不是查表查出来的,就一个乘法:
举例:8B 模型跑 INT4,8 × 0.65 ≈ 5.2 GB
需要解释的是这个系数。单纯装载权重的话,INT4 每个参数占 0.5 字节,8B 模型只要 4 GB。但模型跑起来还要额外一块地方,用来存放对话过程中积累的中间状态,也就是第二篇章讲过的 KV Cache。系数里已经含了这部分开销,所以不要在外面再乘一次余量,否则会算出没有机器跑得动的结论。
量化就是用更少的位数去存每个参数。位数越少体积越小,代价是精度损失。
你可以在上面的计算器里把精度从 FP16 切到 INT4,看能跑的型号变化。量化是把本地部署门槛拉低最有效的一招,一张 8 GB 的显卡跑不动 FP16 的 8B 模型,换成 INT4 就轻松了。
NVIDIA 显卡
- 显存独占,标称多少基本就能用多少
- 带宽高,生成速度快,同尺寸模型体感明显更流畅
- 容量是硬上限,消费级卡目前顶到 32 GB 左右
- 软件生态最成熟,遇到问题基本都能搜到解法
Apple Silicon
- CPU 与 GPU 共享统一内存,系统不允许全部划给 GPU
- 计算器里按可分配的约 75% 折算,这是保守估计
- 容量优势大,高配机型能装下消费级显卡碰不到的尺寸
- 带宽通常不及同价位独显,大模型上生成速度会慢一些
简单说:NVIDIA 拼速度,Apple 拼容量。如果你想跑 30B 以上的模型,一台大内存的 Mac 往往比消费级显卡更现实;如果追求响应速度,独显更合适。
iogpu.wired_limit_max 调整,75% 是默认情况下的保守估计,不是硬上限。
结果列表里带 A 字样的是 MoE 模型,比如 Qwen3-30B-A3B,意思是总参数 30B、每次实际激活 3B。这类模型有个容易踩的坑:
这意味着 MoE 特别适合显存充裕但希望响应快的场景,比如大内存的 Mac。反过来,如果显存紧张,同样占用下选一个稠密的小模型更划算。
上面所有数字都是估算,实际占用还会受这几个因素影响:
- 上下文长度。这是最大的变量。你把上下文从 4K 开到 128K,KV Cache 的占用会涨好几倍,原本跑得动的模型可能就崩了。
- 并发数量。同时处理多个请求,每个都要自己的一份中间状态。个人用一般不涉及,做服务就要重新算。
- 量化的具体实现。同样叫 INT4,不同工具的实现细节不同,体积会有出入。
- 系统占用。显卡还要给桌面和其他程序留一点,别按满打满算规划。
所以计算器给的是可行性判断,不是精确预算。结论是「勉强」的时候,就当作跑不动来准备。
知道能跑什么之后,下一节把它真正装起来。两个工具,命令行的 Ollama 和图形界面的 LM Studio,十分钟能跑通。