Token 降本增效 · 6 / 13

图片 Token:像素也要交税

文字 BPE 是「合并字符」,图片编码是「切割像素」。你以为传的是原图,其实模型按缩放对齐后的分辨率计费——这里面藏着和文字 32k 红线一模一样的跳档陷阱。

像素切块32 对齐分辨率诅咒预算分级
图片是怎么变成 Token 的

视觉模型把图片切成固定大小的像素块,每块对应一个 Token。以通义千问 VL 为例,核心公式是:

图像 Token = (h̄ × w̄) / token_pixels + 2
变量含义说明
h̄ / w̄缩放后的高与宽会被强制对齐到 32(或 28)的整数倍
token_pixels每个 Token 对应的像素数Qwen3-VL 是 32×32=1,024;QVQ / Qwen2.5-VL 是 28×28=784
+2固定开销视觉起止标记 <vision_bos> 和 <vision_eos>

GPT-4o 和 Gemini 用的是图块(Tile)机制:GPT-4o 每个 512×512 图块约 170 Token,Gemini 1.5 Pro 每个 768×768 图块约 258 Token。类比理解:文字的词表大小决定压缩率,图片的像素块大小决定压缩率——32×32 比 28×28 更省。

图像如何转化为 Token:切割像素与核心公式
文字 BPE 合并字符,图片编码切割像素。更大的像素块 = 更高的压缩效率 = 更少的 Token。(图:作者分享原稿)
交互演示 · 你的图片值多少 Token

选一个常见分辨率,或者自己拖宽高。注意 1000×1000 和 1025×1025 这对「孪生陷阱」。计费假设:Qwen3-VL,token_pixels = 1,024,输入价 1 元/M(32k 内标准档)。

1000 px
1000 px
对齐后尺寸
图像 Token
单张成本
凑满 32k 需要几张
32 像素对齐的跳档陷阱
图片只大了 2.5%,但跨过 1024 这个 32 的整数倍边界,Token 数跳了 6.5%——和文字的 33k 全量结算是同一个逻辑。(图:作者分享原稿)
分辨率诅咒:边际效用递减

传 4K 图是不是比 1080p 效果更好?不一定,而且大概率不值。

分辨率缩放后(32 对齐)Token 数相对成本
512 × 512512 × 5122581x
1080p (1920×1080)1920 × 10882,0427.9x
2K (2560×1440)2560 × 14403,60214x
4K (3840×2160)3840 × 21768,16231.6x
8K (7680×4320)触发缩放上限~16,38463.5x

从 512 到 1080p,Token 涨 8 倍,识别精度有明显提升;从 2K 到 4K,Token 再涨一倍,精度提升可能肉眼不可见。你以为在为「更清晰」付费,实际上在为「更多像素块」付费——而这些多出来的像素块,对模型理解内容的帮助是递减的。研究表明 VLM 的视觉 Token 冗余高达 85%。

多图场景更危险:5 张 4K 图 ≈ 40,000 Token,直接把你从标准档踢进高价档——和「RAG 检索 5 个文档拼到 33k」是同一个坑。
策略:按任务分级,匹配分辨率
任务类型Token 预算对应分辨率理由
粗粒度分类(猫还是狗)< 300512 × 512不需要细节
场景理解(图里在干什么)< 1,000~1000 × 1000够用
OCR / 图表分析< 4,000~2000 × 2000需要识别文字
高精度检测(医疗影像)< 16,3844K+按需开启 vl_high_resolution_images

落地动作有三个:前端预压缩(上传前把图片压到目标 Token 数以内,卡住分辨率红线)、任务分级(按上表匹配,别拿 4K 做分类)、多图预算池(批量图片累计 Token 接近 32k 就截断,逻辑和上一节的 RAG 预算截断完全一致)。

预算感知的图片处理三大策略与三条红线
前端预压缩、任务分级匹配分辨率、多图场景的 32k 红线。(图:作者分享原稿)
图片成本的三条红线
红线阈值后果应对
32 像素对齐尺寸跨过 32 的整数倍Token 数跳变前端预处理,主动对齐
32k 输入档位多图累计 > 32k Token全量按高价区结算类似 RAG 的预算截断
高清滥用4K+ 原图无脑传成本涨 30 倍,精度提升有限按任务分级,匹配分辨率
本节要点

图片按缩放对齐后的分辨率计费,不是按你传的原图。公式:(h̄×w̄)/token_pixels + 2。

高分辨率的收益递减:4K 比 1080p 贵 4 倍,理解能力未必更好。按任务分级匹配分辨率。

多图场景做预算池:累计接近 32k 就截断或压缩,别让第 5 张图把整单拖进高价区。

内容来源:整理自作者团队内部分享《AI Token 降本增效策略分享》「图片 Token 的计费机制」。官方规则见阿里云百炼视觉理解文档;「分辨率诅咒」的学术来源见 CARES 论文