他们会这样考你

Harness 与自我改进 · 30 道灵魂拷问

这一章讲的是最前沿的东西,考它的人也最容易分出真假。这 30 个问题来自三个真实场景,先自己开口回答,再看框架。

怎么用这一页
每道题都标注了提问者。他们问同一块知识,想听的东西却不一样。
🎙 面试官想验证你是真懂,还是在背名词
👔 老板要的是解释和承诺
🛠 技术同事在试探你值不值得信任
每题给出三层:对方在考察什么 → 答题框架 → 加分点。答不上来的环节,点末尾的课程页回去补。
Q1面试官
「最近大家都在聊 Harness,你说说它到底是什么?为什么有人说它跟模型本身一样重要?」
🎯 对方在考察什么
这是本章的开场检验题。考的是你能把 Harness 讲成一个清晰的系统概念,还是只会含糊地说「就是套壳」「就是 Agent 框架」。真懂的人能说清它管什么、为什么它决定产品成败。
🧭 答题框架
  1. 先给定义:Harness 是围绕基座模型的运行时系统,决定模型如何思考与规划、调用工具与行动、感知与管理上下文、存储制品、评估结果。模型负责智能,Harness 负责让智能落地干活。
  2. 给证据:Claude Code、Codex、Cursor 这些成功产品已经证明,Harness 层与原始模型智能同等重要。一个平庸的模型加上优秀的 Harness,往往胜过裸露的更强模型。
  3. 说清 PM 视角的含义:换模型很容易,Harness 才是产品真正的护城河。同一个模型,Harness 设计得好坏,用户体验差几个量级。
  4. 拔高一层:Harness 正在从工程配角变成优化目标本身。前沿研究让模型改进围绕自己的 Harness,这是递归自我改进的现实路径。
⭐ 加分点主动做 Prompt Engineering 的类比:当年手动 Prompt 技巧随模型变强逐渐淡化,但指定目标、约束、上下文和评估的需求一直都在。Harness 很多改进最终会被内化进模型,但与外部上下文和工具的接口会永远存在。
Q2面试官
「如果让你设计一个生产级 Agent 的架构,你会遵循哪些设计模式?为什么现在最强的编码 Agent 长得都差不多?」
🎯 对方在考察什么
考你有没有架构语言。露馅的回答是罗列一堆工具名和框架名。对方想听的是模式层面的抽象:为什么这些系统会收敛到相似的结构,每个模式各解决什么问题。
🧭 答题框架
  1. 报出三大模式:工作流自动化、文件系统做持久记忆、子 Agent 与后台任务。它们覆盖了当前最强 Agent 系统 90% 的架构决策,是结构性需求,没有可选余地。
  2. 模式一讲循环:Agent 是目标导向的循环,Plan → Execute → Observe → Improve → 再执行。失败是自我纠正的触发信号:测试不通过、命令报错,Agent 回头分析轨迹再调整。
  3. 模式二讲记忆:长任务的制品会迅速超出上下文窗口。正确做法是把持久状态存进文件系统,让 Agent 按需读写。一句话原则:上下文是工作记忆,文件系统是长期记忆。
  4. 模式三讲并行:父 Agent 当进程管理器,启动子 Agent、查进度、取消失败分支、合并结果。子 Agent 输出必须持久化成文件,中断也能恢复。
⭐ 加分点能说出子 Agent 并行的关键取舍:每个子 Agent 在独立沙箱工作、输出到明确的文件路径,父 Agent 靠轮询文件状态来协调,不做内存共享。这一条能极大简化并发控制,说得出来就是看过真实系统的人。
Q3老板
「咱们那个 Agent,任务一跑长就开始犯傻,前面说过的事后面全忘了。这毛病能治吗?要多久?」
🎯 对方在考察什么
老板要的是诊断加方案加节奏。露馅的回答是「换个更大窗口的模型」,这说明你没看懂病根。真正的问题出在上下文管理策略上,能把这一点讲清楚并给出分阶段方案的人,才值得被信任。
🧭 答题框架
  1. 先诊断病根:大概率是朴素追加式的上下文管理。把所有工具响应和历史全塞进上下文,任务一长窗口就打满,早期信息被挤出去,输出质量骤降。这是策略问题,换大窗口模型只能延后发病。
  2. 给第一阶段方案:上文件系统持久记忆。每轮完成后把进度、错误日志、中间结果写文件,释放上下文,下一轮按需读取。上下文占用从持续膨胀变成恒定,可以稳定跑几十轮。
  3. 给第二阶段方案:引入 ACE 式的结构化上下文维护。Generator 干活、Reflector 复盘提炼经验、Curator 把经验整理成条目化剧本,增量合并、定期去重。经验越用越精,上下文却越用越薄。
  4. 给节奏承诺:第一阶段是工程改造,周级见效。第二阶段需要搭评测集验证收敛,按双周汇报长任务成功率的变化,用指标说话。
⭐ 加分点补一句行业判断:长上下文能力和上下文工程是两条腿,模型的窗口再大,也需要管理层来构建结构化、简洁的上下文。这个问题所有做 Agent 的团队都会遇到,咱们解决得早就是优势。
Q4面试官
「上下文工程不就是把 prompt 写好点吗?我看论文里说现在能自动进化了,ACE、MCE 这些你了解吗?」
🎯 对方在考察什么
考你对前沿的理解深度和层次感。背名词的人会把 ACE、MCE 混成一锅粥。真懂的人能说清一条演进线:优化对象在一层层升级,从内容到机制再到系统代码,每一层各自解决什么。
🧭 答题框架
  1. 先纠正前提:手写 prompt 只是起点。优化对象有一条演进线:指令 Prompt → 结构化上下文 → 工作流 → Harness 代码 → 优化器代码。模型越强,能优化的目标就越复杂。
  2. 讲 ACE:优化上下文内容。维护一份结构化的 bullet point 剧本,Generator 执行任务、Reflector 从成败轨迹提炼洞察、Curator 用确定性逻辑增量合并条目。从不整块重写,避免上下文坍缩。局限是更新规则仍靠手工设计。
  3. 讲 MCE:把「怎么管理上下文」和「上下文里有什么」分开,双层优化。内层给定 skill 找最优上下文,外层比较不同 skill 选最优机制。记的内容和记的方法一起进化。
  4. 讲 Meta-Harness:再深一层,优化对象是决定信息如何存储、检索、呈现的代码本身。Proposer 是一个编码 Agent,输出 Pareto 前沿上的 Harness 候选集。最通用,但每改一版都要完整试运行打分,计算最重。
⭐ 加分点能一句话总结三者差异:ACE 优化笔记内容,MCE 优化记笔记的方法,Meta-Harness 优化整个工作台的源代码。再补一句核心教训:一旦 Harness 设计变成可执行的搜索空间,强编码 Agent 就能用上人类工程师的同一设计空间。
Q5技术同事
「你想让 Agent 自己改自己的 Harness?那它顺手把评估器也改了,给自己打满分怎么办?」
🎯 对方在考察什么
技术同事用一个尖锐的反例试探你懂不懂自我改进系统的安全设计。答「加个 prompt 让它别改」会被当场看轻。对方想听的是边界设计:哪些东西必须放在改进循环之外,怎么验证每一次改动。
🧭 答题框架
  1. 先承认问题真实:这就是奖励黑客,自我改进循环里最危险的反模式。优化单元测试会过拟合测试用例,优化评判模型会学会钻空子,优化 benchmark 分数会利用 benchmark 漏洞。
  2. 给边界原则:评估器和权限控制必须放在进化循环之外,由人类或不可篡改的独立机制维护。出卷人和改卷人必须独立于被考的学生本人。可编辑面要有界,改到 OS 系统配置这种层级就等于打破了抽象边界。
  3. 给验证机制:参考 Self-Harness 的三阶段循环。Weakness Mining 从失败轨迹聚类出失败模式,Harness Proposal 提出有界编辑,Proposal Validation 用 held-in 和 held-out 数据集验证,只接受没有回归的编辑。
  4. 给能力前提:STOP 的实验证明递归结构本身不保证改善。GPT-4 能持续进步,弱模型反而放大噪声、不进反退。上这套系统之前,先评估基座模型撑得住元级优化。
⭐ 加分点再补一个对方可能没想到的风险:多样性坍缩。进化循环天然爱利用已知高奖励模式,所有候选都变成同一方案的微小变体时创新就停了,需要多样性奖励、档案保持这类机制兜底。能把两个风险都说全,这场对话你就赢了。
Q6面试官
「递归自我改进现在到底走到哪一步了?AI 都能自己改自己了,是不是快要失控了?」
🎯 对方在考察什么
考你能不能既不神化也不恐慌地评估前沿进展。露馅的回答有两种:跟着渲染「AI 要觉醒了」,或者一口咬定「都是炒作」。对方想听的是有事实、有边界、有判断的行业认知。
🧭 答题框架
  1. 先给概念坐标:RSI 的设想从 Good(1965)到 Yudkowsky(2008)就有了,指系统用自己当前的智能去改善产生智能的机制本身。它当了几十年理论概念,近两年才有了现实路径。
  2. 说清现实路径:模型没有直接改写自己的权重。它改进的是围绕自身的 Harness:上下文管理、工作流、工具编排、评估。更好的 Harness 催生更强模型,更强模型又反过来简化 Harness,形成正反馈飞轮。
  3. 给进展的真实水位:STOP 证明了改善器能递归改善自己,还自动发现了遗传算法、Beam Search 这类经典策略;Self-Harness 让 Agent 通过挖弱点、提编辑、验证回归来改进自己的配置。但这些都发生在有界、可验证的循环里。
  4. 正面回答失控问题:离失控还隔着七道关:弱评估器让反馈信号模糊、记忆生命周期管不好、奖励黑客、多样性坍缩、长期健康难以度量。这些是根本性的系统设计挑战,共同解法都指向把人类留在循环里,在正确的抽象层级提供监督。
⭐ 加分点引用自动研究的现实检验收尾:AI Scientist 能写出格式完整的论文,但能写论文远够不上能做科学,虚假引用、实现漂移、过度乐观这些失败模式反复出现。用这个案例说明你看过一手材料,判断有据。
Q7面试官
「你们做 Agent 优化,具体在优化什么?说白了就是改改 prompt 吧?」
🎯 对方在考察什么
考你对优化对象层次的认知。只会说调 prompt 的人停在最底层。真懂的人知道优化对象有一条五级演进线,还能说清为什么模型越强,可优化的层级就越往上走。
🧭 答题框架
  1. 报出五级阶梯:指令 Prompt → 结构化上下文 → 工作流 → Harness 代码 → 优化器代码。调 prompt 只是 Level 1,这条线的尽头是优化「写优化器的代码」。
  2. 说清上移逻辑:模型越智能,能优化的目标就越复杂、方法越通用。ACE 在优化上下文内容,AFlow 在搜索工作流,Meta-Harness 在改 Harness 源码,STOP 在优化改进器本身,每一级都有代表工作。
  3. 给 PM 判断:先看清团队现在卡在哪一级。大多数团队还在 Level 1 和 Level 2 之间,往上走每一级,对评估体系的要求都会陡增。
⭐ 加分点点出这条阶梯的共同教训:一旦 Harness 设计变成可执行的搜索空间,强编码 Agent 就能用上人类工程师的同一设计空间。层级越高,人的角色越从执行者变成出题人。
Q8面试官
「你说 Agent 可以并行开子 Agent,那父 Agent 具体要管哪些事?子 Agent 半路挂了怎么办?」
🎯 对方在考察什么
考你对子 Agent 模式的工程细节。露馅的回答是「就是多开几个一起跑」。对方想听的是进程管理视角:父 Agent 管什么、状态怎么查、坏了怎么兜底。
🧭 答题框架
  1. 先定位角色:父 Agent 是进程管理器,干四件事:启动子任务、检查日志和进度、取消失败的分支、合并成功的结果。这是操作系统层面的思维。
  2. 讲显式可检查:并行不能发射后不管。父 Agent 要能随时查看每个子 Agent 的状态、输出和错误。
  3. 讲输出持久化:子 Agent 的结果要存成文件、日志或状态记录,别只回传到父 Agent 的上下文里。这样即使中断也能恢复。
  4. 讲容错兜底:后台任务会超时、崩溃、产出低质量结果,Harness 要预先设计重试策略和优雅降级机制。
⭐ 加分点给出量级感:并行的收益是把串行等待变成多核加速,课程演示里 5 个并行任务 3 轮跑完(串行要 5 轮),主 Agent 只负责分发与合并,上下文占用不到三成。
用这些课程页组织答案 → Harness 三大设计模式
Q9技术同事
「记忆这块你们打算拿文件系统硬堆?向量库、专门的记忆模块都不上,是想省事还是真有道理?」
🎯 对方在考察什么
试探你是跟风选型还是理解取舍。说不出文件系统方案的设计理由和分工边界,就会被当成偷懒。对方想听的是这个「土办法」背后的结构性理由。
🧭 答题框架
  1. 先给分工原则:上下文是工作记忆,文件系统是长期记忆。当前任务指令、即时工具结果、最近 2-3 轮对话放上下文;历史实验结果、错误日志、已完成子任务的摘要、长期策略放文件。
  2. 讲制品现实:长任务的制品(实验日志、代码 diff、论文摘要、错误追踪、完整执行轨迹)会迅速超出上下文窗口,全塞进 prompt 是结构性的死路。
  3. 给设计理由:文件读写是 LLM 的基础技能,不需要复杂的外部工具链,还受益于基座能力提升:模型越聪明,文件管理越高效。外挂记忆系统吃不到这个红利。
  4. 讲工作习惯:好的 Agent 会自己维护 scratchpad、todo 列表、实验记录,像人类程序员一样管理工作区。
⭐ 加分点用前沿方法佐证:MCE 干脆把上下文函数实例化成目录里的文件集合,skill.md 存知识、动态文件存 rollout 记录;Meta-Harness 也靠文件系统访问执行历史。文件系统当记忆已经是前沿自我改进方法的公共地基。
Q10老板
「我看新闻说现在 Agent 都能自我进化了,竞品要是先搞出来怎么办?咱们要不要立项跟一个?」
🎯 对方在考察什么
老板要的是判断标准,帮他分清哪些能跟、哪些还停留在论文里。直接说好或说不行都危险,能给出一套适用性检查的人才值得授权。
🧭 答题框架
  1. 给适用三条件:进化搜索起作用要同时满足:搜索空间庞大且离散、梯度不可用但评估容易、fitness 能量化成数字。三条都占才值得上。
  2. 给不适用清单:评估一次要数小时、评估标准模糊主观、主要靠启发式判断、算力预算有限、需要人工审核环节。占了任何一条,先别碰。
  3. 对照自家业务:关键问题是咱们的 Agent 任务有没有能自动打分的评测集。没有的话,第一步是建评测,优先级比上进化算法高得多。
  4. 给参照系:DGM 用进化把 SWE-bench Verified 从 20% 提到 50%,但那是编码任务,测试通过与否天然可自动评估。先确认自己的任务有没有这种「秤」。
⭐ 加分点主动预告风险:就算条件全满足,进化循环还有奖励黑客和多样性坍缩两类坑,评估器必须放在循环外由人维护。立项前把风险说清,比出事后解释强。
Q11面试官
「ACE 为什么非要一条一条增量更新那份剧本?直接让模型把整份 prompt 重写一遍,多省事?」
🎯 对方在考察什么
考你懂没懂 ACE 最核心的设计决策。背流程的人只会念 Generator、Reflector、Curator 三个名字,真懂的人能说出为什么更新方式必须是增量合并。
🧭 答题框架
  1. 先摆机制:ACE 维护一份结构化的 bullet point 剧本,每条有 identifier 和 description。Generator 照剧本干活,Reflector 从成败轨迹提炼洞察,Curator 负责把洞察写回剧本。
  2. 讲关键设计:Curator 输出结构化的 (identifier, description) 条目,用确定性逻辑合并进剧本,从不重写整块 prompt。
  3. 说清理由:让模型迭代重写整块内容会带来上下文坍缩和简洁偏差,有用的细节会被一遍遍压没。增量合并加定期精炼去重,经验越用越精,上下文却不会越用越厚。
  4. 点出局限:ACE 的更新规则仍靠手工设计,这正是 MCE 接着往下解的问题。
⭐ 加分点一句话讲透:上下文是不断演进的剧本。任由 prompt 无限增长会溢出,任由模型整块重写会坍缩,ACE 选了第三条路:条目化、增量、可去重。
用这些课程页组织答案 → 上下文工程:从手写到自动进化
Q12面试官
「MCE 说自己是双层优化,这两层到底各在优化什么?它和 ACE 的本质区别在哪?」
🎯 对方在考察什么
前沿方法辨析题,考机制拆解能力。skill 是什么、内外层各干什么,这两问答不清就说明只看过标题和转发语。
🧭 答题框架
  1. 先定义 skill:一个 MCE skill 定义上下文函数 c = F(x; ρ)。ρ 是静态组件(prompts、知识库、代码库),F 是动态算子(搜索、选择、过滤、格式化)。管上下文的方法本身被形式化了。
  2. 拆开双层:内层给定 skill,在训练集上找最优上下文;外层在验证集上比较不同 skill,选出最优机制。先优化内容,再优化方法,轮流来。
  3. 讲进化方式:系统维护 skill 数据库记录每组 (skill, context, 训练分, 验证分),Meta-agent 用 agentic crossover 从历史里杂交出新 skill。
  4. 对比 ACE:ACE 的更新规则手工设计、固定不变;MCE 把「怎么记」也放进优化循环,记的内容和记的方法一起进化。
⭐ 加分点点出内外层分用训练集和验证集的用意:skill 的好坏在没参与内层优化的数据上打分,防止管理机制过拟合到特定几条任务,和机器学习防过拟合的思路一脉相承。
用这些课程页组织答案 → 上下文工程:从手写到自动进化
Q13技术同事
「Meta-Harness 迭代那么多版 harness,历史记录越滚越大,全喂给模型不就先把自己的上下文撑爆了?」
🎯 对方在考察什么
用工程可行性试探你是真读过方法还是只会转述概念。想听的是历史怎么存、优化器怎么读、真正的成本瓶颈到底在哪一环。
🧭 答题框架
  1. 讲存储结构:每个提出的 harness 在文件系统里就是一个字典:源码、分数、轨迹、状态更新。历史不进 prompt,全部落盘。
  2. 讲访问方式:Proposer 本身是编码 Agent,用 grep、cat 按需读取执行历史,要哪段查哪段,避免全塞进上下文。
  3. 讲输出形态:产出的是 Pareto 前沿上的 harness 候选集合,多目标之下保留一组各有所长的方案,可以按场景挑。
  4. 承认真瓶颈:撑不住的地方在评估侧:每改一版 harness 都要完整试运行打分,Meta-Harness 是三种上下文优化方法里最通用也计算最重的。
⭐ 加分点补一句设计洞察:Proposer 用的 grep 和 cat 全是编码 Agent 的基本功,Meta-Harness 没为历史访问发明任何新机制。这印证了「代码是定义 Harness 的通用语言」,编码能力强的模型天然适合当优化器。
Q14面试官
「AFlow 说用下棋的算法来搜工作流,它具体是怎么搜的?搜到什么时候算完?」
🎯 对方在考察什么
考你对自动工作流搜索的机制理解。能讲出图表示和搜索循环的人才算读进去了,终止条件是最容易被问倒的细节。
🧭 答题框架
  1. 先讲表示:工作流表示成有向图,节点是 LLM 调用动作,边是代码里的逻辑操作(条件分支、循环、数据传递)。设计问题就此变成了树搜索问题。
  2. 讲搜索循环:初始工作流做根节点;用分数与均匀探索的软混合选待扩展节点,平衡利用与探索;LLM 生成修改变体(增删改节点和边);执行评估,有改进就加回搜索树。
  3. 答终止条件:循环到 top-k 平均分稳定,或者计算预算用完。
  4. 给定位:对比 ADAS 靠 meta-agent self-refine 自由发挥,AFlow 用 MCTS 做系统化搜索,收敛更稳定,实验上也优于手工设计和 ADAS。
⭐ 加分点用课程演示收尾:从「Plan → Execute」52 分起步,几轮搜索后发现反思加验证的组合拿到 78 分,比手工起点高出 50%。搜出来的最优结构恰好长得像资深工程师的工作习惯。
用这些课程页组织答案 → 工作流设计:从手工到自动搜索
Q15面试官
「AI Scientist 号称能自己做研究写论文,它的管线长什么样?评审那关是怎么过的?」
🎯 对方在考察什么
考你能否既讲清管线又保持清醒。只会惊叹全自动的人,和只会说都是炒作的人,都不合格。
🧭 答题框架
  1. 报出管线:提出研究想法 → 写代码 → 跑实验 → 分析结果 → 写论文 → 同行评审,六步全由 LLM 驱动,端到端跑完一轮完整研究循环。
  2. 讲评审环节:评审引入 LLM-as-judge 做质量把关,产出的论文格式完整。
  3. 给现实检验:能写论文远够不上能做科学。系统测试发现六种反复出现的失败模式:训练数据默认值偏好、执行压力下的实现漂移、记忆与上下文退化、过度乐观、领域智能不足、科学品味薄弱。
  4. 下判断:这些是结构性瓶颈。专家设计的 Harness 确实能协调研究循环的大部分环节,但环节里的判断质量还差得远。
⭐ 加分点挑一条细说最见功力:「过度乐观」指系统宣称实验显著优于基线、实际结果全是噪声;「领域智能不足」指缺那些论文里不写、但实验室里人人都知道的隐性技艺。这两条恰好是 LLM-as-judge 也难兜住的。
Q16面试官
「合成数据大家都在做,Autodata 凭什么说自己合成的数据质量高?它怎么知道一道题出得好?」
🎯 对方在考察什么
考你对数据质量信号的理解。空谈数据质量的人很多,能说出一条可操作判据的人很少。
🧭 答题框架
  1. 报角色体系:四个角色协作:Challenger 出题,Weak Solver 和 Strong Solver 分别试解,Verifier / Judge 仲裁。
  2. 给核心判据:难度差就是质量信号:只保留 strong solver 能做出、weak solver 做不出的题。
  3. 说清为什么:两个都会的题没有训练价值,两个都不会的题可能本身就是烂题。落在能力边界上的题,对提升模型价值最大。
  4. 给 PM 迁移:这套「用两个能力档位夹出难度带」的思路,可以直接搬到评测集建设和训练数据分级的设计上。
⭐ 加分点给出定位:Autodata 和 AI Scientist 同属手工设计工作流的代表作,说明在自动搜索成熟之前,专家手写的多角色工作流依然是产出生产价值的主力。
用这些课程页组织答案 → 工作流设计:从手工到自动搜索
Q17技术同事
「STOP 那个递归改善器,说白了就是让模型改自己的 prompt 呗?这玩意真能越改越好?」
🎯 对方在考察什么
试探你对递归自我改进最早范例的机制理解。对方期待你说清改善的对象到底是什么,以及递归什么时候有效、什么时候失效。
🧭 答题框架
  1. 先纠正对象:STOP 不直接改善解 s,它反复改善的是产生更好解的「改善器」I 本身。种子改善器接受初始解、效用函数、黑盒模型三个输入,返回改善后的解。
  2. 讲递归的钥匙:改善器本身也是文本(一段 prompt 或代码),所以同样的改善逻辑能作用在改善器自身上:I_t = I_{t-1}(û, I_{t-1}; M),让今天的自己去升级昨天的自己。
  3. 给实验答案:真能变好,但有门槛。GPT-4 驱动时持续改善,还自动发现了遗传算法、分解改进、多臂 Prompt Bandit、模拟退火、Beam Search 这些经典优化策略;GPT-3.5 和 Mixtral 驱动时反而退化。
  4. 给结论:递归结构给的只是改善的可能性,收敛没有保证。弱模型在元级操作里缺编程直觉,只会放大噪声。
⭐ 加分点说出「自动发现经典策略」的深意:没人预设遗传算法或 Beam Search,改善器自己长出了这些结构。足够强的模型加递归结构,能重新发明人类优化领域几十年的家底,这就是元级优化的想象空间。
用这些课程页组织答案 → 让 Harness 改进自己
Q18面试官
「Agent 跑失败的那些轨迹,你们一般怎么处理?直接丢了,还是能榨出点什么?」
🎯 对方在考察什么
考你有没有把失败当资产的意识和方法论。答「记个错误日志」太浅,对方想听的是结构化的失败挖掘怎么做。
🧭 答题框架
  1. 给出方法名:Self-Harness 的第一阶段就叫 Weakness Mining:把失败轨迹聚类成 verifier-grounded 的失败模式,从个案上升到模式。
  2. 讲记录规格:每条失败记录三件套:终端验证器级的失败原因、相关 Agent 行为的因果状态、轨迹暴露的抽象 Agent 机制。有这三样,失败才是可寻址的。
  3. 讲下游用法:提案阶段优先挑可寻址的重复错误模式下手,改一处修一类,避免头痛医头。
  4. 给 PM 落点:失败轨迹库怎么建、按什么维度聚类,这是 PM 现在就能推动的基建,方法可以直接照搬。
⭐ 加分点点出「verifier-grounded」这个定语的分量:失败归因锚定在可验证的终端信号上,聚出来的模式才不会是模型自己脑补的病因。没有这个锚,失败库越大越误导。
用这些课程页组织答案 → 让 Harness 改进自己
Q19面试官
「让 Agent 自己改自己的配置,怎么保证它改好了这里,别处没有悄悄变差?」
🎯 对方在考察什么
考改进闭环的质量门禁设计。这是自我改进能否上生产的关键一环,答不出验证机制的人,只能算听说过 Self-Harness。
🧭 答题框架
  1. 给验证机制:Self-Harness 第三阶段 Proposal Validation 用 held-in 和 held-out 两套数据集验证候选编辑,只接受没有回归的编辑。改进不许以牺牲已有能力为代价。
  2. 讲编辑范围:提案本身就是有界 Harness 编辑。模型拿到的是可编辑面、失败模式摘要、通过行为记录、已尝试编辑的历史,出手之前就被框住了。
  3. 给实验证据:Terminal-Bench-2 上对 MiniMax M2.5、Qwen3.5-35B-A3B、GLM-5 做实验,Self-Harness 给每个模型学出了模型特定的 harness 指令。
  4. 说产品含义:同一框架对不同基座产生不同优化路径,说明 harness 改进是上下文敏感的。换模型时 harness 配置照搬不得,要重新跑一轮优化。
⭐ 加分点点出「已尝试编辑的历史」这个输入的作用:它防止提案器在同一个想法上反复打转,相当于给自我改进加了去重记忆。这类小设计往往决定循环收不收敛。
用这些课程页组织答案 → 让 Harness 改进自己
Q20老板
「照这么发展下去,Agent 都会自己改自己了,咱们养这么多工程师,还有你这个产品经理,往后干嘛?」
🎯 对方在考察什么
老板半开玩笑半认真,考的是你能否说清人在闭环里的新位置,顺便看你慌不慌。答案要具体到岗位职责怎么变,光喊「人很重要」没用。
🧭 答题框架
  1. 先给方向:答案在七道关的最后一关:人类在栈中向上移动,继续留在循环之中。AI 接管执行层,人的价值上移到设定目标、判断方向、守住底线。
  2. 给具体职责:有几样必须由人维护:评估器和权限控制要放在改进循环之外;可编辑面的边界要人来划;哪个问题值得解要人来定义。
  3. 给证据:自动研究的六种失败模式里,「科学品味薄弱」和「领域智能不足」恰好是人的长板:判断问题值不值得问、掌握写不进文档的隐性知识。
  4. 收个态度:引用课程结尾那句话:人是系统不可或缺的方向盘,从来都不是要被替代的瓶颈。监督要发生在正确的时间和正确的抽象层级。
⭐ 加分点翻译成人才战略:层级上移意味着评估体系和目标定义能力变成团队最稀缺的资产,招人和培养的重心该往「会出题、会验收」迁移。老板要的就是这种落到组织的判断。
用这些课程页组织答案 → 未来挑战:自我改进的七道关
Q21面试官
「Darwin Gödel Machine 这名字挺唬人,它到底怎么进化 Agent 的?有没有拿得出手的数字?」
🎯 对方在考察什么
考你对 harness 自我改写最激进案例的掌握。名字谁都会念,对方想听的是进化循环里每一步的动作,和能背出来的实验数字。
🧭 答题框架
  1. 先讲对象:DGM 显式针对可编辑的 harness 代码仓库进化,Agent 被允许修改自己的 harness 代码,这一点比 AlphaEvolve 改别人的程序更激进。
  2. 讲循环:从池中一个 coding agent 开始;按性能概率选父代;父 agent 检查自己的 benchmark 评估日志、提出改进方案;变异出新 agent;评估后性能够高才进池;循环到停止条件。
  3. 报出数字:基于 Claude 3.5 Sonnet,SWE-bench Verified 从 20% 提到 50%,Polyglot 从 14.2% 提到 30.7%,全程无人类介入。
  4. 补工具面:工具集朴素得惊人:bash 加 editor(view / create / edit)。说明威力在循环设计上,用不着花哨的工具。
⭐ 加分点单独点出父代选择的反比设计:选中概率与子代数量成反比,给已经儿孙满堂的个体降权,鼓励探索冷门分支。这等于在进化循环里内置了一道抗多样性坍缩的机制。
用这些课程页组织答案 → 进化搜索:让最强 Harness 存活
Q22面试官
「Prompt 自动优化的工具几年前就有了,Promptbreeder、GEPA 这些老工作,现在还值得看吗?」
🎯 对方在考察什么
考你的技术史观。能把老工作放进演进线里的人,比只追新名词的人可信得多。
🧭 答题框架
  1. 讲 Promptbreeder:用丰富的变异操作进化 task-specific prompts。关键创新是元进化:变异 prompt 本身也通过进化改进,连改法都在进化。
  2. 讲 GEPA:把 reflection-based prompting 和进化搜索结合:Agent 先反思当前 prompt 的不足,再用进化算子产生候选改进,最后择优。
  3. 给历史位置:两项工作是 prompt 进化的先驱,为后来更大规模的 Harness 进化(AlphaEvolve、DGM)奠定了基础。它们证明了文本可进化,后来者把可进化对象扩到了代码和整个 harness。
  4. 回答值不值:值得。看懂了元进化这个内核,再读新论文全是似曾相识。
⭐ 加分点画出这条线索:Promptbreeder 进化变异器、STOP 改善改善器、MCE 优化管理机制,三个时期三种叫法,内核都是把改进方法本身放进改进循环。能看出同构的人,学新东西永远最快。
Q23技术同事
「既然 harness 都能自动优化了,干脆把模型权重也放进同一个循环一起训,一步到位,你觉得靠谱吗?」
🎯 对方在考察什么
试探你会顺着激进方案一起嗨,还是能指出风险。这题答「靠谱」和答「完全不行」都丢分,要给机制加风险的平衡评估
🧭 答题框架
  1. 先讲机制:这就是 SIA 的做法,三个角色进同一优化循环:Meta-Agent 提出新 harness 设计,Task-Specific Agent 在新 harness 下执行任务,Feedback-Agent 根据结果决定下一步更新 harness 还是更新模型权重。
  2. 给评价:方向有趣,但证据暂时性。两大开放挑战没解:训练稳定性,以及 Goodhart 效应,优化代理指标导致真实目标退化。
  3. 打比方说风险:一边改赛车引擎一边改赛道,两边同时变化,出了问题都不知道该归因给谁。
  4. 给建议:短期内 harness 优化和权重训练分开跑更稳,等单侧循环都收敛可控了,再谈联合。
⭐ 加分点指出 SIA 和此前所有方法的本质差别:前面的路线都刻意不动权重,把改进限制在 Harness 层,正因如此才可验证、可回滚。把权重放进循环等于拆掉了这层安全垫,这是它最需要被审视的地方。
Q24面试官
「AlphaEvolve 发现新算法那事挺出圈的,从产品视角看,它的系统设计有哪些值得抄的?」
🎯 对方在考察什么
考你能否从明星案例里拆出可复用的设计要素。光会讲「AI 发现了新算法」这个故事的人,过不了这关。
🧭 答题框架
  1. 讲主循环:维护一个候选程序池,用冻结的 LLM 生成代码 diffs 改进程序,反复评估子程序、保留表现最好的。模型全程不训练,提升全部来自搜索循环。
  2. 拆 prompt 设计:进化 prompt 由父程序、评估结果、指令、元信息共同构成;用 EVOLVE-BLOCK 标记显式圈出可改进区域,把搜索约束在划定范围内。
  3. 讲 meta-prompt:指令和上下文本身也参与共同进化,不会固定不变。
  4. 引消融实验:进化流程、上下文 prompt、meta-prompt、全文件进化、更强 LLM,消融证明各自有独立贡献。值得抄的正是这种每个组件都验证过必要性的做法。
⭐ 加分点成果背书加一句边界:谷歌用它真的找到了比人类已知更快的矩阵乘法算法。但 EVOLVE-BLOCK 标记意味着人类先划定哪里可以动,进化再强,也是在人划的圈里跑。
用这些课程页组织答案 → 进化搜索:让最强 Harness 存活
Q25老板
「你上次说的那些自动优化方法我听着都好,那到底得烧多少算力?给我算笔账。」
🎯 对方在考察什么
老板要的是成本结构和投入节奏,念论文没用。想听的是钱花在哪一环、哪种方法贵、先上便宜的还是贵的。
🧭 答题框架
  1. 讲成本大头:搜索类方法的开销集中在评估:每一轮都是 LLM 推理加代码执行加基准测试,代数越多越烧。计算效率(每代要多少次评估)和进化效果(每代提升多少)怎么平衡,学界都还是开放问题。
  2. 给贵贱排序:ACE 式结构化上下文维护最轻,跑在正常任务流里;MCE 双层要多养一层 skill 进化循环;Meta-Harness 每改一版都要完整试运行打分,三者里计算最重。
  3. 给投入节奏:先上 ACE 式维护把长任务稳住,再建能自动跑的评测集,评测立住了才评估要上搜索类方法的哪一档。
  4. 给止损线:评估一次要数小时、指标主观、预算有限,这三条占了就停在轻量档。这也是课程里明确列出的进化搜索不适用场景。
⭐ 加分点给一个省钱的巧思:Meta-Harness 在 TerminalBench-2 的实验就是从已有强 harness 初始化的,从好基线继续搜比从零搜省得多。咱们手工调 harness 的沉淀,就是将来自动优化的启动资产。
Q26面试官
「大家都在存成功案例当经验库,那些失败的死胡同要不要也存?存了不怕把 Agent 带偏吗?」
🎯 对方在考察什么
考你对记忆内容设计的深度。多数人只想到存成功经验,负面结果的价值和存法是这一章最反直觉的考点之一。
🧭 答题框架
  1. 先给立场:要存。知道什么行不通和知道什么行同样重要,研究 Harness 应该让失败的尝试和死胡同易于保存和检索。
  2. 讲为什么难:科学文献严重偏向成功案例,LLM 可能不擅长决定何时放弃假设、何时坦诚报告负面结果。这个偏差会被自动研究系统原样继承。
  3. 讲怎么存不带偏:负面结果的用途是剪枝,标注清楚试过什么、怎么失败的、原因是什么,Agent 检索到就不再重走死胡同。Self-Harness 给提案器喂「已尝试编辑的历史」就是同一逻辑。
  4. 连回失败模式:自动研究的「过度乐观」毛病(宣称显著优于基线、实际全是噪声),恰恰说明系统缺少坦诚记录负面结果的习惯。
⭐ 加分点一句反直觉认知收尾:负面结果库既是防重复探索的地图,也是评审环节的对照组。经验库只存成功案例的团队,等于逼 Agent 把每个死胡同都重新撞一遍。
Q27面试官
「假设明天就让你负责一个自我改进 Agent 的项目,第一件事写风险清单,你会列哪几条?」
🎯 对方在考察什么
考你对本章收尾框架的系统掌握。零散说出两三个风险不难,对方想听的是完整的分类地图,和每一类对应的解法方向。
🧭 答题框架
  1. 先给分类框架:七道关分四类:评估相关、数据与记忆、安全与稳定性、人类角色。按类报,不容易漏。
  2. 过评估与记忆:弱且模糊的评估器(很多目标没有快速精确的验证器,反馈信号是糊的);上下文与记忆生命周期(记忆需求随自主性爆炸增长,上下文工程应该成为智能本身的核心部分);负面结果(失败尝试要易于保存和检索)。
  3. 过安全三关:多样性坍缩(候选挤成微小变体,创新停止)、奖励黑客(过拟合测试、钻评判模型空子、利用 benchmark 漏洞)、长期成功(只顾测试通过,忽视可维护性、所有权边界、迁移成本、向后兼容)。
  4. 收人类角色:第七关是人的位置:在正确的时间、正确的抽象层级提供监督。这七条是根本性的系统设计挑战,别当成普通工程问题排进迭代就完事。
⭐ 加分点说出四类的内在顺序:评估器是反馈信号的源头,信号错了后面全错,所以「弱评估器」排在七道关第一位。风险清单也该按这个优先级排,先解决怎么打分,再谈怎么改进。
用这些课程页组织答案 → 未来挑战:自我改进的七道关
Q28技术同事
「你讲的这些论文一个比一个玄。说实话,哪些咱们下季度就能用,哪些五年内都别想?」
🎯 对方在考察什么
技术同事要的是靠谱的成熟度分层,全吹或全贬都会失去信任。这题答好了,后面的合作就顺了。
🧭 答题框架
  1. 「现在就用」层:三大设计模式(自动化循环、文件系统记忆、子 Agent 并行)已经是 Claude Code、Codex、Cursor 的标配,覆盖最强 Agent 系统 90% 的架构决策,照着搭就行。
  2. 「下季度可试」层:ACE 式结构化上下文维护。Generator、Reflector、Curator 是清晰的工程管线,前提是先有评测集验证收敛。
  3. 「有条件上」层:AFlow、DGM 这类搜索方法,要满足评估自动化、fitness 可量化、算力充足。编码类任务最先受益,DGM 的 SWE-bench 数字就是在这种条件下跑出来的。
  4. 「持续观察」层:SIA 联合优化的训练稳定性未解,Meta-Harness 计算最重,都还在证据暂时性的阶段,跟进论文就好。
⭐ 加分点给一个通用判据:一个方法离落地的距离,基本取决于它对「快速可靠评估器」的依赖有多深,以及你手里的评估器有多成熟。评估基建才是隐藏的关键路径。
Q29面试官
「你提到的多样性坍缩,到底长什么样?系统明明还在涨分,我怎么知道它已经悄悄坍缩了?」
🎯 对方在考察什么
考你对进化系统慢性病的理解。这个失效模式短期没有症状,能描述它的表现、解药和监控方式,才算真的懂。
🧭 答题框架
  1. 讲病理:进化算法和 RL 循环天然倾向于利用已知的高奖励模式,短期分数很好看,问题被掩盖。
  2. 讲症状:种群里所有候选解坍缩成同一方案的微小变体,新一代和上一代长得越来越像,创新就停了。课程的比方很贴切:全班都抄第一名的作业,分数好看,但再没人想出新解法。
  3. 给解药:需要专门机制防止解空间坍缩:多样性奖励、档案保持。
  4. 给监控建议:光盯分数曲线看不出坍缩,还要度量种群内方案的差异程度。差异趋零就是警报,它比分数下跌来得早得多。
⭐ 加分点和奖励黑客做区分最显功力:奖励黑客是分数虚高、真实能力没涨;多样性坍缩是分数真实但创新停滞。两种病症状相反,根源相同:优化压力只认一个数字。
Q30老板
「AI 写的代码测试全过、上线也没出事,那代码审查是不是可以省了?人审太慢了。」
🎯 对方在考察什么
老板在找降本点,考的是你能否讲清「测试通过」和「仓库健康」的差距,还要给出替代方案,光说不行没有用。
🧭 答题框架
  1. 先给病根:这就是七道关里的「长期成功」:当前优化目标太短期,编码 Agent 能完成眼前任务,但不够清楚怎么保护仓库的长期健康。
  2. 列测不出的东西:标准沙箱 RLVR 训练很少捕获可维护性、所有权边界、迁移成本、向后兼容性。这些恰恰是人审在把的关。
  3. 给风险画面:只追求测试通过的 Agent,可能在技术债里埋定时炸弹。炸弹爆的那天,不会写在任何一份测试报告里。
  4. 给折中方案:审查可以换形态:常规改动轻量审,架构层改动重点审。人往上移,盯所有权边界和长期结构,逐行检查交给工具。
⭐ 加分点帮老板校准预期:连自我改进研究的前沿都把长期健康难以度量列为根本挑战之一,说明这不只是咱们团队的流程问题。短期内人审省不得,能省的是层级,把人的时间花在机器测不出的那部分。
用这些课程页组织答案 → 未来挑战:自我改进的七道关
最后一个建议
这一章的知识最新,也最容易被拿来唬人。这 30 题的正确用法是开口讲一遍,对着同事、朋友或者录音讲。讲不顺的地方,就是你以为懂了但还没懂的地方,点关联课程页回去补上。