Token 降本增效 · 13 / 13 · 收官
算力时代的极简主义
做完这几层优化,你基本上已经跑赢 90% 的粗放型 AI 产品了。收官这一节,把整个专题串成一张清单,再聊聊「省钱」背后的那件更重要的事。
全景回顾信息密度延伸阅读
省 Token 的本质:提高信息密度
回顾一下,我们聊了 BPE、报价梯队、跳档陷阱、Agent 账单、YAML 格式、压缩算法、KV Cache、停止序列……看起来都是在省钱、抠成本。但往深了想:省 Token 这件事,本质上是在提高信息密度。过滤掉格式噪音、文档废话、重复计算之后,喂给模型的都是干货。密度越高,注意力越不容易分散,幻觉也越少。
高信噪比 = 高智能
还有个副产品:快。Token 少了,首字出得快,端到端延迟短——C 端产品里,这直接决定用户愿不愿意继续用。下次审工程化方案时,用一个标准卡一卡:这里的每一个 Token,都在为最终结果贡献价值吗?如果不是,考虑把它干掉。把算力留给真正的思考——这才是 AI 时代精益计算的美学。
全景清单:13 节内容一张表
跳档陷阱
GLM 200 断崖:输出多 2 个 Token,连输入都回溯涨价。Qwen 32k 红线:越线全量结算,预算感知截断。图片税:32 像素对齐 + 分辨率诅咒,按任务分级。
| 三条通用红线 | 阈值 | 动作 |
|---|---|---|
| 单次输入 | < 32k Tokens | 预算感知截断(RAG、多图、多轮历史通用) |
| Agent 轮次 | < 10 轮 | 熔断机制兜底 |
| I/O Ratio | 监控 > 50:1 | Agent 在空转,先查流程 |
延伸阅读 · 十八个主题
原分享附带了一份按主题分类的阅读材料,从上下文工程、推理框架内核到经济学模型,覆盖本专题所有关键论断的原始出处。按需展开。
一、闭源生态的「上下文工程」与显存优化
拆解 Manus 如何用 "Mask, Don't Remove" 策略把 KV Cache 命中率从 20% 提到 95%——理解闭源模型为何在 Agent 场景成本更低的核心文献。
生产环境中 KV Cache 对成本的决定性影响,以及 vLLM 分布式部署下的缓存失效问题与解法。
二、推理框架内核:vLLM vs SGLang
深度解析 SGLang 的 RadixAttention 如何用树状结构管理显存,以及多轮对话场景为何比 vLLM 更有优势。
针对多轮对话和共享前缀场景的基准测试,量化两种框架在吞吐量和显存利用率上的差异。
三、硬件底层:华为昇腾 910B vs NVIDIA
极详尽的 GPU 规格数据库:H20、H100 与昇腾 910B 的显存带宽、互联速度对比,分析「显存墙」最权威的数据来源之一。
910B 相比 910A 的架构权衡,解释理论算力与实际性能的差距。
MLA 架构模型在 910B 上无法开图模式的具体原因,算子适配的软肋。
四、理论原理:注意力汇聚
为什么前几个 Token 会吸附大量注意力权重——理解 Prefix Caching 为何会固化生成路径、降低多样性的理论基础。
五、VLM 视觉经济学与分辨率研究
「分辨率诅咒」和视觉 Token 冗余高达 85% 的核心来源:动态分辨率选择如何降本不降精度。
How LLMs See Images and What It Really Costs You(Medium)
GPT-4o 的 Patching 机制(512×512 图块与 85/170 Token 计费),理解 OpenAI 阶梯式成本结构。
Google Gemini API Pricing & Tokenization(Google Cloud 官方文档)
Gemini 的 258 Token 固定费率与 768px 大图分块机制,对比 GPT-4o 成本效益的关键依据。
六、Agent 成本陷阱与 SWE-bench 实证
斯坦福团队的 SWE-bench 复盘:「单题成本 $4.60」「生成编辑阶段占 60% 成本」的数据出处。
揭示 Agent 任务「输入主导」现象(输入 Token 占 95%)与「逆缩放」悖论。
七、Prompt 压缩、RAG 与幻觉
微软的 Prompt 压缩经典研究:压缩率(5x vs 20x)与精度下降的量化基准,为何过度压缩会丢逻辑。
RAG 系统的成本权衡:Re-Ranking 成本可高达向量检索 5000 倍的经济学分析。
长上下文和对抗性输入下模型幻觉率的基准测试。
八、核心理论与架构:模型路由
「模型路由」领域最基础的研究之一:用偏好数据训练路由模型,降本的同时保持高性能。
「任务分解」让端侧小模型与云端大模型协同工作,端云混合架构必读。
用困惑度作为动态阈值,自动判断何时进入「深思」模式——路由触发机制的解法。
九、企业级实战案例
Notion 如何按任务类型(写作 vs 问答)把请求路由到不同后端模型——「产品架构即路由」。
AI 客服处理 2/3 用户对话的商业数据:平均处理时长 11 分钟降到 2 分钟。
代码补全这个延迟最敏感的场景,如何结合本地上下文和云端模型做毫秒级路由。
十、端侧与分类器技术
端侧 3B 模型的设计权衡、4k 上下文限制、LoRA 适配器微调。
1B 以下参数模型的极限与「Deep and Thin」架构优化。
为什么有时最简单的正则匹配和关键词检测反而是最高效的路由手段。
用极少样本训练高效意图分类器——低成本路由器的核心组件。
十一、MCP 协议核心与架构哲学
MCP「资源-工具-提示」三大原语的官方定义与设计哲学。
Code Execution vs. Tool Calling(Anthropic 工程博客)
「通过代码执行减少 98% Token 消耗」的原始研究,两种模式的详细对比。
十二、巨头博弈与战略分歧
微软如何把 MCP「降级」为 Semantic Kernel 的一个插件源——「拥抱与扩展」战略。
官方文档明确目前仅支持只读操作:微软对 AI 代理写操作的谨慎与责任规避。
OpenAI 如何通过定义「AI 的 README」控制智能体的指令交互层。
十三、安全风险与企业治理
「影子智能体」、数据泄露,以及 MCP 如何绕过传统 DLP 系统。
拼写错误攻击(Typosquatting)和恶意 MCP 包的案例分析。
企业内网穿透风险与缺乏细粒度鉴权(Confused Deputy)的技术细节。
十四、未来架构:智能体网关
「网关优先」架构解决 MCP 安全问题的最新实践,Agent Gateway 与传统 API Gateway 的区别。
十五、核心框架与方法论
BootstrapFewShot、MIPROv2 等优化器的工作原理:用编程方式优化 Prompt。
代码生成任务中迭代式测试与自我修正流程的开创性工作。
十六、前沿算法
如何通过 LLM 自我评估过滤「相似但有害」的 Few-Shot 样本。
在 LLM 管道中实施断言来自动纠错和回溯——Flow Engineering 稳定性的关键。
十七、经济学模型与 ROI 分析
反直觉的结论:大规模场景下 RAG 可能比微调更贵的临界点在哪里。
根据 Token 价格和调用量估算 SFT 回本周期的实用工具。
十八、企业级监控与基础设施
如何监控 TTFT、Token 效率以及识别异常查询模式的深度指南。
如何设置相似度阈值来平衡缓存命中率与准确性。
收官寄语
✓
省 Token = 提高信息密度:噪音滤掉之后,注意力更集中、幻觉更少、速度更快。
✓
一个审方案的标准:这里的每一个 Token,都在为最终结果贡献价值吗?不是,就干掉。
✓
把算力留给真正的思考——这才是 AI 时代精益计算的美学。
内容来源:本专题整理自作者团队内部分享《AI Token 降本增效策略分享》。想继续深入工程侧,推荐接着看进阶实战篇章的 RAG、Agent 与上下文工程章节。