信任校准:最好的用户是半信半疑的
前四课都在给体验挣分,这一课踩一脚刹车:信任这个指标,目标值从来就没定在满分。AI 会出错是改不掉的物理现实,所以健康的用户长这样:该信的场景放心用,该查的场景留个心眼。往哪边偏都要交学费。这一课先看两笔真实学费,再给你三件能亲手拨弄的校准工具。
⚠ 过度信任:把幻觉当真相用
2023 年纽约的 Mata v. Avianca 案:执业律师用 ChatGPT 检索判例,把 6 个查无此案的编造判例原样抄进法庭文书,法官逐个核实后律师吃了罚单、上了全球新闻。类似的事故此后接连发生:AI 的输出流畅、自信、格式规范,每一个表面特征都在诱导「它很靠谱」的判断,而这些特征和内容真伪互不相干。
⚠ 信任不足:AI 变成昂贵的摆设
另一头的翻车安静得多:企业买了 AI 工具,员工试了一次撞上错误,从此每条输出都逐句复核,复核成本超过自己写,最后干脆不用了。采购的钱照付,效率一分没涨。信任不足不上新闻,只出现在「AI 工具活跃率 8%」的内部复盘里。
判断口诀先给你:盯着「风险 × 可核验性」看,别盯着「AI 强大与否」看。同样是全盘采纳,用在周报上是校准,用在法庭上是过度。六个场景,你来当校准师。
第一件校准工具:来源引用,要能点开的那种。想核实的用户一键到原文,压住过度信任;懒得核实的用户看到「有出处」也建立了合理的底气,补上信任不足。一举两得的前提是引用真实可点:装饰性的假引用被戳穿一次,比没有引用糟糕十倍。下面这条 AI 回答挂了三个角标,逐个点开,和原文比对。
第二件工具:置信度。第一篇章讲过,模型不知道自己不知道,让它自报把握靠不住。但产品层有诚实的代理信号:检索命中了几篇文档、相关度多高、多个来源是否一致、知识截止日期盖住问题了没有。下面是同一条用药回答,三组开关对应三个产品决策,拨一拨,看右边的回答和用户的信任校准度怎么变。
第三件工具管的就一件事:那行「AI 可能出错,请核实重要信息」的小字,到底有没有人在看。心理学的答案叫横幅盲视(banner blindness):Benway & Lane(1998)用眼动实验发现,恒定出现在固定位置的元素,会被大脑当成背景纹理直接滤掉。下面连点五条回答,亲眼看这行小字怎么消失。
✅ 这一课想和你分享的
- 把信任目标定在校准:全信的出事故,不信的白花钱,产品要把用户往对角线上拉
- 引用做成能点开的:把「信我」换成「你可以验」,同时提防装饰性假引用反噬
- 置信度用代理信号说:检索命中数、相关度、来源一致性,比模型自报的把握诚实
- 警告有条件地出现:恒定免责三天就隐形,低置信时带原因弹出才会被读