LLM:Agent 的大脑
本章把 LLM 当作黑盒,从 Agent 开发者的“接口视角”观察它。模型内部结构、预训练与后训练等硬核内容,见站内 CS336 笔记。
LLM 是什么:逐 token 的文本补全器
剥掉所有光环,LLM 只做一件事:给定前面的文本,预测下一个 token(词元),把它接上去,再预测下一个。所谓“生成”,就是这样一步步续写出来的。
这个朴素的定义直接解释了 Agent 开发者每天要面对的三个现象:
- 输出有随机性。下一个 token 是从概率分布里采样出来的(温度控制这个分布的形状),所以同样的 prompt 未必得到同样的回答。Agent 需要稳定行为时,要么调低温度,要么用更强的结构约束(结构化输出、工具签名)。
- 会有幻觉。模型在补全“最像真的文本”,而不是“查证过的文本”。它说得很自信,不代表它知道。Agent 的对策不是祈祷,而是给大脑接上手脚——用工具取来的真实结果替换模型的想象。
- 没有真正的记忆。窗口里的内容它“看得见”,窗口外的内容它不存在。这就是为什么上下文管理值得单独一章。
大脑能做什么、不能做什么
把 Agent 开发者视角下的大脑能力盘一遍:
| 大脑提供 | 大脑不提供 | 缺失由谁补齐 |
|---|---|---|
| 语言理解与生成 | 记忆:窗口合上就忘 | 用户记忆与知识库 |
| 世界知识(冻结在训练数据里) | 实时信息:不知道今天几号 | 工具(搜索、API) |
| 推理与规划 | 行动:说得出,做不到 | 工具 |
| 指令遵循 | 感知:看不见屏幕和文件 | 多模态输入 + 上下文工程 |
| —— | 正确性的保证 | 评估与安全机制 |
这张表同时是全篇的路线图:大脑的每一块缺失,正好对应后续每一章存在的理由。Agent 工程,本质上就是用系统补齐大脑的短板,而不是试图换一颗更好的大脑。
从模型特性到 Agent 行为
不是所有模型特性都值得 Agent 开发者关心。下面几条会直接改变你的设计决策:
上下文窗口有限,且注意力不均匀。 窗口再大(当前主流为 100K~1M token)也是稀缺资源,且模型对窗口中部内容的注意力明显弱于首尾(lost in the middle)。这决定了上下文工程的第一性:不是“能不能塞下”,而是“塞什么、放在哪、何时扔”。
工具调用是训练出来的能力,且水平参差。 现代模型经过后训练,能用固定格式声明“我要调用哪个工具、参数是什么”,API 层会解析并回填结果。但模型选择工具、填参数的可靠性差异很大——工具描述写得含糊,或者一次暴露几十个工具,都会让选错率飙升。工具设计同样是一门手艺(见工具一章)。
推理模型改变了规划的成本结构。 当前模型分为两类:普通模型直接输出答案;推理模型(如 o3、Claude 的 extended thinking)会先在内部进行长链条思考再作答。后者在规划、debug、数学等任务上明显更强,但更慢、更贵。实践中的常见配置是:高层规划用推理模型,具体执行用普通模型——这正是后续“模型路由”话题的雏形。
幻觉无法根治,只能围堵。 有效的围堵手段按性价比排序:给工具、让引用、限制“自由发挥”的空间(结构化输出)、最后才是提示词里写“不要编造”。
多模态:大脑的眼睛
开篇比喻里“眼睛”的位置属于多模态。当前的主流模型已能统一处理文本、图像(截图、照片、文档)、音频,部分支持视频:
- 截图理解让 Working Agent 可以操作 GUI:看懂按钮在哪、对话框说了什么,这是 OpenClaw 这类桌面 Agent 的感知基础。
- 文档与图表理解让 Agent 能读 PDF、看架构图,大幅扩展了 Coding Agent 的输入面。
- 对 Agent 的架构意义在于:感知不再需要先翻译成文字。以前要靠 OCR 和描述模型转述,现在环境可以直接“进入”大脑,保真度更高、延迟更低。
眼睛仍然受同一个物理约束:图像是按 token 计费、占窗口的。一张高分辨率截图可能相当于几千 token,多模态让上下文管理更紧、而不是更松。
模型选择:能力、成本与延迟
Agent 开发者的选型清单,按重要性排序:
- 任务匹配度:代码任务看 SWE-bench,通用任务看 GAIA 之类 Agent 基准——注意榜单分数只反映分布,不代表你的具体任务,最终要用自己的评测集说话。
- 工具调用可靠性:多步 Agent 里模型每一步都要选对工具、填对参数,一次选错全盘皆输。
- 上下文长度:决定了“不压缩能走多远”,但别为长窗口支付过高的单价——长上下文的有效利用率通常远低于标称值。
- 成本与延迟:Agent 是循环调用,一次任务几十次模型调用很常见,单价和首 token 延迟被放大几十倍。
- 思考模式可调:能在“快而糙”和“慢而准”之间切换的模型,更适合规划与执行分离的架构。
一个务实的做法
先把最便宜、最快的模型跑通全流程,评测不达标再逐级换更强的模型。很多团队的反向操作(一上来用最贵的模型)只是延迟了遇到真正问题的时刻。
本章小结
- LLM 是逐 token 的补全器:随机性、幻觉、无记忆都源于此,也都可工程化地围堵。
- 大脑的能力清单和缺失清单,就是整本教程的目录。
- 上下文稀缺且注意力不均、工具调用可靠性、推理模型的成本结构、多模态,是影响 Agent 设计的四大模型特性。
- 模型选择以任务匹配度和工具调用可靠性优先,用自己的评测集说话。