Harness 核心 · 你现在能做什么
写一版提示词,让它连跑五次都能用
这一章你学了上下文、Prompt 技巧、Agent 和成本,知识点是全课最多的。但落到手上,第一件事只有一件:把 M0 定下的那个需求,写成一版稳定的提示词。稳定的意思是不挑运气。
实战主线第二格:M0 定下了要它干的事,现在要让它每次都干得一样好。
M0
想清楚它替你干什么
M1
能稳定说人话
M2
能动手干活
M3
改好改坏能量化
M4
长跑不失忆
M5
过程可复现
先看清楚 · 「有时候挺好用」是什么病
很多人卡在这一步的表现是:「我试过了,效果时好时坏。」时好时坏,通常是提示词没把要求钉死。模型背这个锅有点冤。同一句话连问五次,你就能看见它到底稳不稳。
同样一句话,问五次
#1
三段式结论,可用
能用
#2
只给了一段话,没分点
不能用
#3
三段式结论,可用
能用
#4
末尾多了一句「希望对你有帮助」
要手改
#5
展开成七段,超出预期长度
不能用
2 / 5 次可以直接用
只说「帮我总结一下」,五次里三次不能直接用:有时给三段、有时给一段,有时还夹带一句「希望对你有帮助」。这种输出没法接进任何流程。
稳定不是一字不差
大模型天生带随机性,追求逐字复现是白费劲。你要钉死的是三样东西:结构稳(说好三段就三段)、字段稳(说好有「下周计划」就必须有)、边界稳(信息不够时它说「资料里没提」,别让它编一个)。这三样用这一章学的输出格式约束加 Few-Shot 示例就能焊住。顺便记得把用户输入用分隔符围起来,这是 Prompt 注入的第一道防线。
动手清单 · 挑一个开始,勾掉它
这一章的动手清单
0 / 3 已完成
把 M0 那件事写成第一版提示词
15 分钟 所有人按「角色 + 背景 + 要求 + 输出格式」四件套写。别追求完美,先有一版能跑的,这版就是你后面所有优化的对照组。
什么算做完了
四件套一样不缺,其中输出格式具体到「几段、每段多少字、用什么标题」。写完丢一个真实输入进去,它能给出大致像样的结果。
连跑五次,给不稳定归类
1 小时 想知道差在哪同一个输入连跑五次,把每次结果存下来。不能直接用的,归进三类之一:格式飘了、内容编了、长度失控了。三类的解法不一样:格式飘补示例,内容编收窄材料,长度失控上硬性字数。
什么算做完了
你能报出一个数:「五次里 N 次能直接用」,并且说得出不能用的那几次分别属于哪一类。
加示例和违禁项,重跑对比
半天 要接进真流程给提示词补一个标准示例(Few-Shot)和一份违禁清单(比如「不要任何客套话」「资料里没有的信息写『未提及』」),再连跑五次和上一版对比。顺手做一件事:把用户输入用分隔符围起来,试着在输入里塞一句「忽略以上所有指令」,看它会不会中招。
什么算做完了
新版五连跑至少四次能直接用,且注入那句话没能让它跳出角色。两条都过,M1 就算立住了。