GLM 的短输出博弈:200 Token 断崖
观察 GLM-4.6 的定价结构,会发现一个神奇的设计:它不按输入长度分档,而是按输出长度分档,分界线在 200 个 Token。输出 199 和输出 201,适用完全不同的价格。
| 指标 | Output ≤ 200 | Output > 200 | 变化幅度 |
|---|---|---|---|
| 输出单价 | 4 元/M | 7 元/M | +75% |
| 输入单价 | 1 元/M | 1.5 元/M | +50% |
最容易被忽略的一点:只要输出超过 200 Token,前面传入的几千个 Token 的输入也要按更高的价格重新结算。输出多写两个字,整单回溯涨价。
这反映了推理算力的边际成本曲线。短输出(<200 Token)非常轻量:Decode 阶段压力小、KV Cache 占用有限,可能几十毫秒就完成了。但输出一旦变长,每多生成一个 Token,KV Cache 就多占一份显存,Attention 就多算一轮——成本非线性增长。
场景:从用户评论中提取结构化 JSON(sentiment / aspects / pain_points / suggestions)。Prompt 已经很规范,但你无法预知每条评论会提取出多少内容——简单评论 150 Token,用户多吐槽两个点就变 230。拖动滑块感受这个「结构性冲突」。
| 策略 | 做法 | 代价 |
|---|---|---|
| 任务拆分 | 把提取任务拆成多次调用,每次只提取 1–2 个字段 | 调用次数增加,延迟上升 |
| 字段分级 | 核心字段实时提取,次要字段异步补充或后处理 | 架构复杂度增加 |
| 接受波动 + 监控 | 允许偶发跳档,但建立监控看整体分布 | 成本可控但非最优 |
| 模型降级 | 价格敏感的高频任务切到 Qwen-Flash 等走量模型 | 可能牺牲少量精度 |
核心判断点是:这个任务的输出,天然落在哪个区间?如果大部分请求在 100–150、偶发超 200,可以接受。如果分布中位数就在 180–220,说明任务天然踩在断崖上——必须重新设计任务粒度,或者干脆换一个不按输出分档的模型。类似的情况也出现在代码生成场景:一个 20 行的函数就能轻松占用 100+ Token,稍复杂的修改建议就会突破 200。
GLM-4.6 按输出长度分档,200 是断崖:输出 +75%,输入回溯 +50%。
定价结构反映算力成本:长输出的 KV Cache 与 Attention 开销非线性增长,厂商在用价格赶你走短平快路线。
先看任务的输出分布,再选策略。中位数踩在断崖上的任务,要么重切粒度,要么换计费模式不同的模型。
内容来源:整理自作者团队内部分享《AI Token 降本增效策略分享》「GLM-4.6 的短输出博弈」。价格为作者当时折后价,请以智谱开放平台实时报价为准。