工程指标及格了,用户为什么还骂慢?
前面的章节教你把延迟压下来、把成本抠下来、把幻觉率降下来。这一章换一块秒表:用户脑子里那块。它和服务器的秒表走时不同,打分、续费、卸载都跟着它走。第一课先跑个实验,再把这块表的走时怪癖逐个拆开。
下面四个面板背后是同一次请求:同一个问题,同样 5 秒出完整答案。区别只有一个:这 5 秒里给用户看什么。点按钮让四个同时开跑,留意自己的体感。
方案 A · 空白冻结
什么都不给方案 B · 转圈等待
告诉你它活着方案 C · 流式输出
先给一部分方案 D · 步骤外显
让你看它在干嘛刚才多数人最难受的是空白面板。空白除了难受,还有个隐藏代价:它会放大你对时长的估计。感知时间研究把「一边等一边关注时间」的计时叫前瞻计时:注意力越多押在时间本身上,主观时长越膨胀,紧张情绪再把它拉长一截。Zakay 与 Block 的注意闸门模型是这条规律最常被引用的解释。结论先放这,你自己测一遍更有说服力。
点「开始」后,左边面板会进入一段没有进度、没有转圈、没有文案的等待。凭体感,觉得过了 8 秒就按停。尽量别在心里数拍子,那是作弊。
这就是空白冻结在数据后台看不见的那笔账:服务器记 5 秒,用户记 6 秒半。无反馈等待的高估误差,实验里两三成很常见。你产品的「体感延迟」比监控面板上的 P99 更糟,且差距由界面决定。
秒表既然开在用户心里,工程预算就要花在他计时的区间。下面这台聊天机器人的总时长锁死 5 秒,你只能动一个参数:首字时间 TTFT(从发送到看见第一个字)。拖滑块,点「重放」,右边按所选 TTFT 重演一次打字流,体感分跟着变。
把前面的体感整理成三条可复用的规律。每一档都有个 mini 演示,三档都切一遍。
用户的开表点在按下发送,收表点在看见第一个字。首字之后他的注意力交给了阅读,边读边到的内容几乎没被记进等待的账本。工程团队盯总时长的 P99,用户只记首字,两块表对不上,差评就从缝里钻出来。实验三里 TTFT 那根杠杆的长度,就是这条怪癖给的。
同一次等待:5 秒后答案落地。切换两种结局,看回忆里的时长怎么变。
物理上都是那一次 5 秒。追记式的时间靠事后重建,情绪越糟,重建出来的等待越长。所以延迟和幻觉在差评里常常挤进同一句话:又慢又蠢。答案质量的问题会连坐到速度头上;反过来,好答案也能替你把慢遮掉一截。第 4 课峰终定律会把这条用在结尾设计上。
AI 产品有三个天生毛病:慢(推理要时间)、会错(幻觉压不净)、不透明(用户看不见它在干嘛)。工程手段短期内只能缓解这三样,但用户的评价由感知产生,感知可以设计。你在前面章节学的流式输出、模型路由、语义缓存、Agent 进度汇报,每一个都还有一重心理学开关的身份,这一章教你什么时候为了心理效果去拨它。
慢、会错、不透明,每个毛病后面都排着几课;再往后是关系和钱。点卡片翻面,看每一课要解决用户的哪句抱怨。
✅ 这一课想和你分享的
- 盯两块秒表:服务器计物理时长,用户从发送计到首字,考核指标里给 TTFT 单开一行
- 别让界面空白:无反馈等待会被放大两三成,超过 1 秒就给反馈,超过 3 秒就给进展
- 预算先压首字:接流式、先出提纲、分段返回,排期都在升级机器前面
- 错误当场兜住:时间记忆跟着情绪走,答非所问会把慢一起写进差评