开源专题 · 在自己的机器上跑起来
Ollama 与 LM Studio 怎么上手
上一节算出了你能跑什么,这一节把它装起来。两个工具,一个命令行一个图形界面,第一次用十分钟能跑通。
先选工具
Ollama
命令行
- 一条命令下载并运行,没有多余步骤
- 装好后自动在后台提供服务,可以直接被程序调用
- 接口兼容 OpenAI 的格式,原来调 API 的代码改个地址就能用
- 没有图形界面,换模型、调参数都要敲命令
适合你,如果:你要把本地模型接进自己的程序,或者习惯用终端。
LM Studio
图形界面
- 内置模型浏览器,能看到体积和量化档位再决定下不下
- 会提示当前机器能不能带得动,对新手很友好
- 也能开本地服务器,同样兼容 OpenAI 格式
- 在 Apple 芯片上支持 MLX 引擎,比通用格式更快
适合你,如果:你想先试几个模型比较一下,或者不想碰命令行。
不用纠结,两个可以都装。它们下载的模型文件互不冲突,很多人用 LM Studio 挑模型和试效果,用 Ollama 跑常驻服务。
Ollama:从零到跑通
装好 Ollama 之后,只需要一条命令。以上一节算出你能跑 8B 为例:
ollama run qwen3:8b
就这一句。本地没有就先下载,下完自动进入对话。想只下载不运行,把 run 换成 pull。其余常用命令:
# 看已经下载了哪些模型,以及各占多少空间
ollama list
# 删掉不用的,本地模型很占硬盘
ollama rm qwen3:8b
# 看当前正在占用显存的模型
ollama ps
装好后 Ollama 会在本机 11434 端口提供服务,接口格式跟 OpenAI 一致。也就是说第七篇章写过的调用代码,把 base_url 指过来就能跑,模型名填标签名即可。
from openai import OpenAI
# 本地服务不校验密钥,api_key 随便填一个非空值
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "用一句话解释什么是量化"}],
)
print(resp.choices[0].message.content)
上面那条命令里的 8b 是举例。你自己该敲哪个数字,取决于你的机器。选一下,下面直接给出你能复制走的那条。
选完直接点复制,这条命令装好 Ollama 就能用。
平台
型号
主要用途
标签怎么读
冒号后面那串不是随便写的,每一段都有含义。
qwen3:30b-a3b-q4_K_M
qwen3模型系列名。
30b-a3b尺寸。带 a 的是 MoE,这里表示总参数 30B、激活 3B。上一节讲过,显存要按 30B 准备。
q4_K_M量化档位。不写的话会用默认档,见下一段。
第一个坑:你跑的默认就是量化版。不写量化后缀时,Ollama 拉的通常是 Q4 档,不是原始精度。很多人拿它跟官方 API 的效果比,觉得开源模型不行,其实比的根本不是同一个东西。要对比质量,先确认两边跑的是不是同一个档位。
量化档位怎么选
Q4_K_M
默认选它。体积和质量的平衡点,绝大多数工具的默认档。日常问答、总结、改写这类任务上够用。
Q5_K_M
体积略大,质量更稳。如果你主要拿来写代码或做数学题,选这一档更保险,这两类任务对精度损失比较敏感。
Q8_0
接近原始质量,体积也接近翻倍。显存充裕又想要最好效果时用。
Q3 及以下
除非显存实在不够,否则不建议。掉分开始明显,还不如换个小一号的模型跑高一档量化。
一条实用规律:模型越大,量化越安全。32B 模型量化到 Q4 掉的那点分,往往还是比 8B 跑 Q8 强。所以显存有限时,优先保尺寸,再考虑档位。
可用标签会随版本更新,实际拉取前建议到
ollama.com/library 对应模型的 tags 页确认当前有哪些尺寸与档位。核对日期 2026-08-07。
LM Studio:点几下就行
1
在模型库里搜索
搜模型名,列表会列出各个量化版本的体积。界面会根据你的机器提示哪些带得动,这一点比命令行直观很多。
2
下载后直接聊天
加载模型时可以调上下文长度和 GPU 分配。这两个参数直接影响显存占用,先用默认值跑通再调。
3
需要给程序调用时,开本地服务器
在服务器面板里启动,同样是 OpenAI 兼容接口,用法和上面的 Ollama 例子一样,只是端口不同。
4
Mac 用户注意选 MLX 版本
如果模型有 MLX 格式,优先选它。这是针对 Apple 芯片优化的引擎,同样的模型速度会明显好于通用格式。
还有三个常见的坑
- 上下文开太大,显存直接爆。这是最高频的问题。模型加载时显存看着够,一旦把上下文拉到几十 K,KV Cache 涨上来就崩了。现象是生成到一半卡死,或者速度突然慢到不可用。先按默认上下文跑通,需要长文再一档一档往上加。
- 显存不够时不一定报错。有些工具会自动把装不下的部分放到内存里,靠 CPU 算。结果是能跑,但慢十倍以上。如果你发现生成速度慢得离谱,先检查是不是没完全装进显存。
- 硬盘会被吃掉。一个 8B 的 Q4 模型三四个 GB,试几个模型就是几十个 GB。定期用
ollama list看一眼,不用的删掉。
三条路,什么时候走哪条
到这里,你手上有三种用模型的方式了。它们不是替代关系,各有各的场合:
- 本地跑。数据不能外发、要长期高频调用、或者想完全不受服务商影响时。代价是能力上限受硬件限制。
- 官方 API。要最强能力、不想管运维时。按量付费,用多少算多少。
- 中转站。便利性和风险并存,具体的取舍在《什么是 API 中转站》那一节讲过,涉及数据经手第三方的问题,选之前建议回去再看一眼。
这一章到此结束。你现在应该能自己判断一个模型的开放程度、知道小模型是怎么来的和它的代价、并且能在自己的机器上把它跑起来。