Token 降本增效 · 4 / 13

GLM 的短输出博弈:200 Token 断崖

观察 GLM-4.6 的定价结构,会发现一个神奇的设计:它不按输入长度分档,而是按输出长度分档,分界线在 200 个 Token。输出 199 和输出 201,适用完全不同的价格。

输出分档回溯计价任务拆分边界波动
现象:不仅输出涨价,输入也回溯涨价
指标Output ≤ 200Output > 200变化幅度
输出单价4 元/M7 元/M+75%
输入单价1 元/M1.5 元/M+50%

最容易被忽略的一点:只要输出超过 200 Token,前面传入的几千个 Token 的输入也要按更高的价格重新结算。输出多写两个字,整单回溯涨价。

智谱为什么这么定价

这反映了推理算力的边际成本曲线。短输出(<200 Token)非常轻量:Decode 阶段压力小、KV Cache 占用有限,可能几十毫秒就完成了。但输出一旦变长,每多生成一个 Token,KV Cache 就多占一份显存,Attention 就多算一轮——成本非线性增长。

厂商通过价格杠杆传递信号:鼓励短平快的任务,惩罚冗长的生成。
交互演示 · 在断崖边反复横跳的账单

场景:从用户评论中提取结构化 JSON(sentiment / aspects / pain_points / suggestions)。Prompt 已经很规范,但你无法预知每条评论会提取出多少内容——简单评论 150 Token,用户多吐槽两个点就变 230。拖动滑块感受这个「结构性冲突」。

150 Tokens
100← 200 断崖 →320
输入单价(3k 上下文)
1 元/M
输出单价
4 元/M
单次调用成本
业务波动性与定价断崖的结构性冲突
业务输出天然在 150–230 之间波动,而断崖恰好画在 200:这是业务波动性与定价断崖的结构性冲突。(图:作者分享原稿)
四种应对策略
策略做法代价
任务拆分把提取任务拆成多次调用,每次只提取 1–2 个字段调用次数增加,延迟上升
字段分级核心字段实时提取,次要字段异步补充或后处理架构复杂度增加
接受波动 + 监控允许偶发跳档,但建立监控看整体分布成本可控但非最优
模型降级价格敏感的高频任务切到 Qwen-Flash 等走量模型可能牺牲少量精度

核心判断点是:这个任务的输出,天然落在哪个区间?如果大部分请求在 100–150、偶发超 200,可以接受。如果分布中位数就在 180–220,说明任务天然踩在断崖上——必须重新设计任务粒度,或者干脆换一个不按输出分档的模型。类似的情况也出现在代码生成场景:一个 20 行的函数就能轻松占用 100+ Token,稍复杂的修改建议就会突破 200。

本节要点

GLM-4.6 按输出长度分档,200 是断崖:输出 +75%,输入回溯 +50%。

定价结构反映算力成本:长输出的 KV Cache 与 Attention 开销非线性增长,厂商在用价格赶你走短平快路线。

先看任务的输出分布,再选策略。中位数踩在断崖上的任务,要么重切粒度,要么换计费模式不同的模型。

内容来源:整理自作者团队内部分享《AI Token 降本增效策略分享》「GLM-4.6 的短输出博弈」。价格为作者当时折后价,请以智谱开放平台实时报价为准。