大模型原理 · 你现在能做什么

别停在「我懂了」,先把那件事定下来

原理讲完,最容易发生的事是:你觉得学到了很多,但合上电脑,手上什么都没多。
所以从这里开始,每章结尾都有这么一页,只回答一个问题:学完这章,你今天能动手做什么

全课有一条实战主线:做出一个真能干活的 Agent。六个里程碑各推进一格,你现在在第一格。
M0
想清楚它替你干什么
M1
能稳定说人话
M2
能动手干活
M3
改好改坏能量化
M4
长跑不失忆
M5
过程可复现
先看清楚 · 需求要收敛到什么程度才算数

大多数人给 AI 布置任务,停在第一段就交卷了:「帮我处理一下周报」。这句话没错,只是它没法验收。你不知道什么样的输出算成功,自然也不知道该不该改提示词。往下推三段,它才变成一个真需求。

从一句愿望到一个能验收的需求

01
一句愿望

「帮我处理一下周报」,想法有了,但也只是想法

02
定输入输出

进:一周的零碎记录;出:三段结论加一份下周计划

03
定什么算对

三段都能直接发给老板,一个字不用改

04
挑压幻觉的方案

要引具体数字,那就走 RAG,别让它凭记忆编

卡在第二段,这个需求还没法验收
停在「帮我处理一下周报」,第二段就卡住:输入是什么、输出长什么样,你自己都没想清楚。后面两段根本没机会跑。「试了一下感觉不行」,原因通常就在这儿。

第四段为什么要单拎出来

这一章你学了四种压幻觉的办法:改提示词、RAG、调 Temperature、加评测。选哪个,看你的活儿会在哪儿出错。这不是四选一的偏好题。要引具体数字和条款,走 RAG;格式老是飘,改提示词再把 Temperature 调低;要长期跑、怕它悄悄变差,那就得有评测。选错了不要紧,但一开始就不选,等于把幻觉留给用户去发现

动手清单 · 挑一个开始,勾掉它

这一章的动手清单

0 / 3 已完成

把那件事写成四行

15 分钟 所有人

照着上面四段,写下你最想交给 AI 的那件事:一句愿望、输入是什么、输出长什么样、什么算对。写在便签、备忘录、随便哪儿都行,但必须是写下来的字,不能只是脑子里的想法。

什么算做完了
把这四行念给一个不了解你工作的人听,他能复述出「AI 要交出什么」。做不到,说明第二、三段还太虚。

用 5 个真实输入试它一遍

1 小时 想先验证可行性

别用编的例子。翻出五份真实材料丢给它,一次一份,提示词保持一模一样。重点是看它在哪一类输入上开始胡说,答得好不好先放一边。材料太长?信息缺失?有内部专有名词?把出错的那一类记下来。

什么算做完了
你能说出一句具体的话:「输入里一旦出现某某,它就开始编。」笼统的「有时候不太准」不算。

划一条人机分界线

半天 准备真做一个

把这件事拆成「AI 做」和「你做」两半,写清交接点长什么样。比如:AI 出初稿并标出所有它不确定的数字,你只核对被标出来的那几处。分界线划在哪儿不重要,重要的是它必须能被检查

什么算做完了
你能回答:如果 AI 那一半出错了,你在哪一步、用什么方式会发现?答不上来,说明这条线划得太靠后了。

写完了就存进建造日志

建造日志会一路陪你到协作方法论篇。六个里程碑填满,你手上就是一份完整的 Agent 设计说明。内容存在你自己的浏览器里,随时能导出成 Markdown。

去填 M0