长期记忆
记忆注入的成本问题
记了 1000 条记忆,每次对话全塞进 system prompt?还是按需检索相关的几条?全量注入简单但贵且噪声多,按需检索省钱但可能漏。
拖动滑块,感受记忆数量的影响
全量注入(全部塞进 prompt)
注入 tokens—
每次调用成本—
噪声占比—
实现复杂度 极简
按需检索(只注入相关的)
注入 tokens—
每次调用成本—
噪声占比—
实现复杂度 需要检索系统
推荐策略
记忆注入的推荐做法
用户发消息
新一轮对话开始
→
语义检索
找相关记忆
(3~10条)
(3~10条)
→
精准注入
只塞相关的
进 system prompt
进 system prompt
→
模型回复
有上下文的
高质量回答
高质量回答
核心原则:记忆的价值在于每次能拿出最相关的几条,记了多少条并不重要。全量注入在记忆少的时候可行,但随着记忆增长,按需检索是唯一可扩展的方案。
记忆不是越多越好。1000 条全塞进去,AI 反而找不到重点。好的记忆系统像一个称职的秘书:不会把整个档案柜搬到会议室,只会提前把今天会议需要的三份文件放在桌上。