Skip to content

LLM:Agent 的大脑 ​

本章把 LLM 当作黑盒,从 Agent 开发者的“接口视角”观察它。模型内部结构、预训练与后训练等硬核内容,见站内 CS336 笔记。

LLM 是什么:逐 token 的文本补全器 ​

剥掉所有光环,LLM 只做一件事:​给定前面的文本,预测下一个 token(词元),把它接上去,再预测下一个​。所谓“生成”,就是这样一步步续写出来的。

这个朴素的定义直接解释了 Agent 开发者每天要面对的三个现象:

  • 输出有随机性。下一个 token 是从概率分布里采样出来的(温度控制这个分布的形状),所以同样的 prompt 未必得到同样的回答。Agent 需要稳定行为时,要么调低温度,要么用更强的结构约束(结构化输出、工具签名)。
  • 会有幻觉。模型在补全“最像真的文本”,而不是“查证过的文本”。它说得很自信,不代表它知道。Agent 的对策不是祈祷,而是给大脑接上手脚——用工具取来的真实结果替换模型的想象。
  • 没有真正的记忆。窗口里的内容它“看得见”,窗口外的内容它不存在。这就是为什么上下文管理值得单独一章。

大脑能做什么、不能做什么 ​

把 Agent 开发者视角下的大脑能力盘一遍:

大脑提供大脑不提供缺失由谁补齐
语言理解与生成记忆:窗口合上就忘用户记忆与知识库
世界知识(冻结在训练数据里)实时信息:不知道今天几号工具(搜索、API)
推理与规划行动:说得出,做不到工具
指令遵循感知:看不见屏幕和文件多模态输入 + 上下文工程
——正确性的保证评估与安全机制

这张表同时是全篇的路线图:大脑的每一块缺失,正好对应后续每一章存在的理由。Agent 工程,本质上就是​用系统补齐大脑的短板,而不是试图换一颗更好的大脑​。

从模型特性到 Agent 行为 ​

不是所有模型特性都值得 Agent 开发者关心。下面几条会直接改变你的设计决策:

上下文窗口有限,且注意力不均匀。 窗口再大(当前主流为 100K~1M token)也是稀缺资源,且模型对窗口中部内容的注意力明显弱于首尾(lost in the middle)。这决定了上下文工程的第一性:不是“能不能塞下”,而是“塞什么、放在哪、何时扔”。

工具调用是训练出来的能力,且水平参差。 现代模型经过后训练,能用固定格式声明“我要调用哪个工具、参数是什么”,API 层会解析并回填结果。但模型选择工具、填参数的可靠性差异很大——工具描述写得含糊,或者一次暴露几十个工具,都会让选错率飙升。工具设计同样是一门手艺(见工具一章)。

推理模型改变了规划的成本结构。 当前模型分为两类:普通模型直接输出答案;推理模型(如 o3、Claude 的 extended thinking)会先在内部进行长链条思考再作答。后者在规划、debug、数学等任务上明显更强,但更慢、更贵。实践中的常见配置是:​高层规划用推理模型,具体执行用普通模型​——这正是后续“模型路由”话题的雏形。

幻觉无法根治,只能围堵。 有效的围堵手段按性价比排序:给工具、让引用、限制“自由发挥”的空间(结构化输出)、最后才是提示词里写“不要编造”。

多模态:大脑的眼睛 ​

开篇比喻里“眼睛”的位置属于多模态。当前的主流模型已能统一处理文本、图像(截图、照片、文档)、音频,部分支持视频:

  • 截图理解让 Working Agent 可以操作 GUI:看懂按钮在哪、对话框说了什么,这是 OpenClaw 这类桌面 Agent 的感知基础。
  • 文档与图表理解让 Agent 能读 PDF、看架构图,大幅扩展了 Coding Agent 的输入面。
  • 对 Agent 的架构意义在于:感知不再需要先翻译成文字。以前要靠 OCR 和描述模型转述,现在环境可以直接“进入”大脑,保真度更高、延迟更低。

眼睛仍然受同一个物理约束:图像是按 token 计费、占窗口的。一张高分辨率截图可能相当于几千 token,多模态让上下文管理更紧、而不是更松。

模型选择:能力、成本与延迟 ​

Agent 开发者的选型清单,按重要性排序:

  1. 任务匹配度:代码任务看 SWE-bench,通用任务看 GAIA 之类 Agent 基准——注意榜单分数只反映分布,不代表你的具体任务,最终要用自己的评测集说话。
  2. 工具调用可靠性:多步 Agent 里模型每一步都要选对工具、填对参数,一次选错全盘皆输。
  3. 上下文长度:决定了“不压缩能走多远”,但别为长窗口支付过高的单价——长上下文的有效利用率通常远低于标称值。
  4. 成本与延迟:Agent 是循环调用,一次任务几十次模型调用很常见,单价和首 token 延迟被放大几十倍。
  5. 思考模式可调:能在“快而糙”和“慢而准”之间切换的模型,更适合规划与执行分离的架构。

一个务实的做法

先把最便宜、最快的模型跑通全流程,评测不达标再逐级换更强的模型。很多团队的反向操作(一上来用最贵的模型)只是延迟了遇到真正问题的时刻。

本章小结 ​

  • LLM 是逐 token 的补全器:随机性、幻觉、无记忆都源于此,也都可工程化地围堵。
  • 大脑的能力清单和缺失清单,就是整本教程的目录。
  • 上下文稀缺且注意力不均、工具调用可靠性、推理模型的成本结构、多模态,是影响 Agent 设计的四大模型特性。
  • 模型选择以任务匹配度和工具调用可靠性优先,用自己的评测集说话。

参考 ​

最近更新