Token 降本增效 · 3 / 13
报价表速览与三大梯队
把常用模型的定价摊开在一张表上,你会看到三个清晰的梯队。但仅仅知道哪个贵、哪个便宜是远远不够的——真正的成本刺客,藏在那些价格跳变的边界线里。
T0 旗舰T1 主力T2 走量缓存价
报价表全景
下面是作者团队当时主要使用的模型定价(已折算折扣后,单位:元 / 百万 Token)。三列分别是非缓存输入、缓存输入、输出——注意缓存价普遍只有标准价的两成甚至更低,这个巨大的差价就是第 11 节 KV Cache 的伏笔。
| 模型 | 档位 | 输入(非缓存) | 输入(缓存) | 输出 |
|---|---|---|---|---|
| GLM-4.6 (355B A32) | Input ≤32k · Output ≤200 | 1 | 0.2 | 4 |
| Input ≤32k · Output >200 | 1.5 | 0.3 | 7 | |
| Input 32k–200k | 2 | 0.4 | 8 | |
| Qwen3-Max | Input 0–32k | 1.6 | 0.32 | 6.4 |
| Input 32k–128k | 3.2 | 0.64 | 12.8 | |
| Input 128k–252k | 4.8 | 0.96 | 19.2 | |
| Qwen-Plus (235B A30) | 0–128k · 非思考 | 0.4 | 0.08 | 1 |
| 0–128k · 思考模式 | 0.4 | 0.08 | 4 | |
| Qwen-Flash | Input 0–128k | 0.075 | 0.015 | 0.75 |
| Input 128k–256k | 0.3 | 0.06 | 3 | |
| GLM-4.5V / 4.5-Air | Input 0–32k | 1 | 0 | 3 |
| Input 32k–64k | 2 | 0 | 6 |
红色数字是「跳档后」的价格。同一个模型内部,价格能差 2–3 倍——这些边界线是第 4、5、6 节的主角。
三大梯队
T0 · 旗舰
Qwen3-Max、GLM-4.6(长输出档)
输出昂贵,能力天花板。留给复杂推理、代码生成、多模型仲裁这类「答错了损失更大」的任务。
T1 · 主力
Qwen-Plus、GLM-4.5-Air
性价比均衡。日常对话、RAG 问答、摘要归纳的主力,大部分请求应该落在这一层。
T2 · 走量
Qwen-Flash
近乎免费(缓存输入 0.015 元/M)。数据清洗、意图分类、高频监控随便跑,也是给大模型「打下手」的最佳人选。
懂技术的人看模型参数,懂经营的人看定价阶梯。做 AI 工程,两个都要懂。
交互演练 · 这个任务该用哪个梯队
五个真实业务场景,选一个你认为最合适的梯队。原则:能用便宜的绝不用贵的,但答错代价大的别省。
本节要点
✓
先分梯队再选型:T0 管难题、T1 管日常、T2 管走量。大部分成本事故是「用 T0 干 T2 的活」。
✓
缓存价是标准价的 1/5 甚至更低。能不能吃到这个折扣,取决于你的架构设计(见第 11 节)。
✓
同一模型内部价格能差 2–3 倍。跳档边界线(输出 200、输入 32k)比模型选型本身更值得盯。
内容来源:整理自作者团队内部分享《AI Token 降本增效策略分享》。表中为作者当时的折后协议价,各家牌价与折扣随时在变,选型前请核对 DeepSeek 定价、阿里云百炼与智谱开放平台的实时报价。