它会一本正经骗你,三道防线
AI 说错话的时候语气和说对话完全一样。学习场景里,错的会被你当成知识存进脑子。这一页给你三道能当场用的防线。
Niblane 是为这一页编的笔记索引命令行。示意文档只承认两件事:根目录的 niblane.toml(字段只有 notes_dir 和 index_path),以及 niblane search 只查本机 .niblane/index.db。下面五条是简化过的 AI 说法,真假混在一起。
Niblane 从项目根目录读 niblane.toml。用 notes_dir 指定笔记目录。缺这个文件时会报找不到配置。
Niblane 0.4 于 2018 年发布。作者在那年的 NoteCon 上做过现场演示,随后被写进官方入门教程。
在 niblane.toml 里写 hot_reload = true,保存笔记后索引会自动重建,不必再跑 niblane index。
niblane search 只查本机 .niblane/index.db。默认不发网络请求。
niblane 有 --sync-cloud,可以把本地笔记推到官方云。官方文档第 4 节写过启用步骤。
工作里,AI 写错一段代码,跑一下就红了。方案写偏了,评审会拦下来。现实会打回来。
学习里没有这个反馈。它用同样平稳的语气说出一个错的年份、一个不存在的参数。你读着顺,就写进笔记。几个月后考试或动手做,才发现这块是空的。中间这段时间,错的已经当知识用了。
所以学习场景里,幻觉的代价更高。它不会当场爆,会在你脑子里住下来。
先认出几类高发区。碰到这些,默认当可疑,先走防线,再决定信不信。
版本号、阈值、百分比、一次能处理多少条。数字听起来精确,就容易过关。
谁在哪一年发布,哪次会上讲过。时间线具体,读的人很少去对公告。
函数签名、默认值、配置项名字、报错码。一个不存在的键,也能写得很像真的。
资料少的工具、冷门论文、内部文档的细节。外面可核对的材料少,编造更不容易被撞上。
还有第五类:问它某个工具有没有某个功能,它倾向于说有。上面体检台里的云同步,就是这一类。
这些位置需要精确的名字、数字、路径。模型在这里最容易补一个听起来合理的词。这是用下来的经验。
警觉要花在这些位置上。每句都去翻原文,学习会停住。高发区先标出来,精力才用得上。
你问完,它答完,看起来完整。你没有检查入口。过几天你只记得结论,不记得它有没有给出处。
漏掉检查,错的会进笔记。对的也会和错的混在一起,以后分不出来。
三道防线,每道都有一句可以直接贴进对话的提问。
1. 要出处
能不能指到原文,指到文档的哪一节。指得出来,你再决定要不要点进去看。指不出来的部分,先当未核实。
2. 交叉验证
换个问法再问一次,或者换一个模型问同一个问题。两次答案不一致的地方,就是可疑区。
3. 让它标注不确定
明确要求它区分我确定和我推测,并且把推测的部分单独列出来。推测可以留着,只是不要和确定混写。
别让它讲,让它考你 里,提问结构的第四个部件就是让它预警你可能理解错的地方。和第三道防线是同一类动作:逼它把没把握的部分说出来。
出处把说得顺和能指到材料拆开。交叉验证利用它换一种生成路径时对不上的地方。标注不确定是明确下指令,让它把推测从结论里剥出来。
这三道都是经验做法。挡得住一部分编造,挡不住它把编造写得很像出处。所以还要知道什么时候必须离开对话,去看原文。
带 AI 精读一个大型开源仓库 那一页的机器校验,是这三道防线的工程化版本。出处变成文件加行号,交叉验证变成脚本重读源文件。
三道防线会花时间。每句都去翻原文,学习会停住。完全不查,错的会进脑子。
先看这句话你拿去干什么。
要拿去做决策的,去查原文。数字,去查。法律、医疗、安全这类后果重的,去查。其余场景,可以接受一定风险,用三道防线收窄可疑区就够。
还有一个反直觉的点。越是它答得流畅完整的地方,越值得抽查。它对熟悉领域和编造内容的语气没有区别。顺、完整、语气稳,都不能当证据。
查原文的成本和用错的代价要匹配。决策、数字、重后果,用错一次就贵。其余地方,用防线把风险收到你能接受的程度。这是经验,不是哪一篇论文量出来的阈值。
流畅完整是生成风格。抽查要抽看起来最像真的那些,因为那些最容易被你放行。
常见做法
读完就信,或者凭语气判断稳不稳。时间省在前面。错的进笔记,很久以后才可能被发现。
代价:错的当知识留下这一页的做法
先看高发区,走三道防线,按后果决定查不查原文。决策和数字类问题会多几轮对话,也会慢一点。
代价:多几轮提问,小问题会被压得偏重拿你这周正在学的一个概念走一遍
让 AI 讲一遍这个概念。然后把上面三句提问依次贴进去。
把未核出处和我推测抄下来,挑一条你准备写进笔记的,去对原文。记下它指没指到、对没对上。