Skip to content

Agent 的持续进化 ​

教程行至此处,最后一个问题自然浮现:Agent 能不能越用越聪明?本章讨论“进化”的四个层次——从人帮它积累,到它自己积累,再到模型本身的迭代。

层次一:经验沉淀(人策展) ​

最低成本、当下最可靠的进化:把运行中学到的东西固化回系统。

  • 记忆文件的生长:每个新项目的约定、每个失败案例的教训,写进 AGENTS.md、记忆文件或 Skill。下次同类任务直接受益。
  • 评测集的增长:每个 bad case 变成一个测试用例(见评估一章)——系统对“犯过的错”免疫。
  • 工具与 Skill 库的积累:重复出现的操作流程封装成 Skill,团队共享。

这一层没有魔法,本质是组织知识管理,但它是后面所有层次的基座。

层次二:自我改进(Agent 策展) ​

让 Agent 自己参与经验的沉淀与修正:

  • 会话结束的自动提炼:Agent 复盘本次任务,把值得记住的写入记忆(写入需人审或经安全策略把关)。
  • 自我批评与修复循环:生成 → 自查 → 修正的多轮机制,用“另一个视角”审查自己的产出(独立评审 Agent 是其多智能体形态)。
  • 技能生成:发现某类操作反复手工描述,自动起草一个新 Skill 供人审核入库。

边界要清醒:自我改进的写入必须可控(否则错误经验自我强化),且“改进”的效果要能被评测集验证——没有评估闭环的进化,无法区分变聪明和变固执。

层次三:模型层进化(训练驱动的底层抬升) ​

更根本的进化发生在模型本身:

  • Agent 式 RL 训练:用可验证奖励(测试通过、任务完成)对模型做强化学习,模型把“会循环、会试错”内化为参数而不是 prompt。前沿模型的大部分 Agent 能力来自这里。
  • 长时程能力的快速抬升:衡量“Agent 能自主工作多长时间才需要人介入”的时间尺度(如 METR 的 time-horizon 度量)呈现稳定指数增长——每过几个月,可委托的任务时长翻倍。

这一层的含义是:今天写进 Harness 的某些补偿逻辑,明天会变成模型的原生能力。保持 Harness 与模型的边界清晰,才能在模型进步时顺畅地删掉过时的补丁。

层次四:生态进化 ​

最后是系统之外的演进:MCP 工具生态在扩张、A2A 让 Agent 互联、开源 Harness 在互相借鉴。单个 Agent 的能力边界,越来越取决于它能接入的生态。

进化的护栏 ​

四层进化叠加之后,必须守住两条底线:

  1. 可回滚。记忆、Skill、配置的每次变更都可追溯、可撤销——进化不应是单向门。
  2. 可验证。每次“变聪明”都要过同一套评测集。进化系统中,评估就是免疫系统。

结语 ​

回到开篇的比喻:Agent 的一切工程,都是在给一颗借来的大脑补齐眼睛、手脚与记忆。这本教程讲的所有内容——上下文、记忆、工具、编排、安全、评估——都是这套“身体工程”的零件。零件的图纸还在快速迭代,但装配的思路是稳定的:用系统的确定性,包裹模型的不确定性;用机制的护栏,放大模型的判断力。

参考 ​

最近更新