Prompt Harness

System Prompt 不是一坨文本

生产级的 System Prompt 不是想到什么写什么。它是分层管理的:身份层、环境层、工具层、行为层,各管各的,改一层不影响其他层。

「一坨文本」长什么样

常见的混乱写法

你是一个 AI 助手,名字叫 Alice。你可以搜索网页、读写文件、 现在是 2026 年,用户在中国。当用户让你搜索时用 web_search 工具, 回答时先思考再回答,不要编造信息。你的性格温暖友善, 文件操作用 file_read 和 file_write,用户的语言偏好是中文, 如果不确定就告诉用户你不知道...
身份、环境、工具、行为全混在一起。改一处可能影响全部,谁也说不清哪段影响了哪个行为。
分层管理:四层各司其职

点击每层查看它负责什么

身份层

我是谁?性格、角色、基本人设

定义 AI 的身份认同:
  • 名字、角色定位
  • 性格特征(友善 / 严谨 / 幽默…)
  • 基本能力边界(能做什么、不能做什么)
特点:几乎不变,一旦定好很少修改。

环境层

现在什么情况?系统状态、用户上下文

提供当前运行时信息:
  • 用户基本信息(语言偏好、时区…)
  • 当前操作系统、应用状态
  • 会话上下文(在哪个页面、之前做了什么)
特点:每次会话可能不同,但同一会话内相对稳定。

工具层

能用什么?可调用的工具和 API

注册 AI 可以使用的工具:
  • 工具名称和功能说明
  • 参数格式
  • 使用限制和注意事项
特点:随着功能迭代增删,变化频率中等。

行为层

怎么行动?输出格式、决策规则

规定 AI 的行动策略:
  • 回答风格和格式要求
  • 决策优先级(先做什么、后做什么)
  • 安全护栏(什么不能做、什么要确认)
特点:是产品迭代最频繁的部分:改一条策略就能改变 AI 行为。
分层的好处

改一层不影响其他层

加个新工具?只改工具层。调整回答风格?只动行为层。不会牵一发而动全身。

多人协作不冲突

产品改行为、工程师加工具、运营调人设,各改各的文件,Git 合并不冲突。

A/B 测试更精准

想测试不同的回答策略?只替换行为层,其他三层保持不变,变量单一。

排查问题更容易

AI 行为异常?按层检查:是身份搞错了、环境信息过时、工具描述有误、还是规则冲突?

一坨文本改一处可能影响全部。分层管理,改一层不影响其他层。生产级的 System Prompt 是四个独立管理的模块。