第10章:从 Prompt 到 Agent——AI 能力跃迁的分水岭
系列导读:本章是 Agent 模块的开篇。建议先看第1-5章建立 LLM 和工具调用的基础认知,再进入 Agent 的学习。
一、为什么说 Prompt 和 Agent 之间有一道鸿沟?
Prompt 时代:你给模型一个指令,模型给你一个回答。对话结束。
Agent 时代:你给模型一个目标,模型决定需要什么信息,去搜索、执行、验证,最终给你一个完整的解决方案。
这个分水岭就是:自主性(Autonomy)。
| 能力 | Prompt | Agent |
|---|---|---|
| 理解任务 | 被动接收指令 | 主动解析目标 |
| 工具调用 | 没有 | 自主决定用什么工具 |
| 多步执行 | 没有 | 可执行多步操作链 |
| 状态保持 | 无(每次独立) | 有(记忆系统) |
| 结果验证 | 没有 | 自检查/自修正 |
| 闭环能力 | 开环(输出即结束) | 闭环(输出→行动→反馈→再决策) |
二、理解 Agent:不是「加了工具的 LLM」
最常被误解的概念:Agent 不是"给 LLM 加了几个 Function Calling"。
真正的 Agent 有三个核心特征:
1. 自主决策
模型自己判断「下一步该做什么」,不是人类在每个节点发指令。
2. 行动-感知-调整闭环
模型执行一个行动(如搜索),收到结果,然后根据结果调整下一步的计划。
3. 状态管理
在多步执行过程中,模型知道自己之前做了什么、当前进展到哪一步。这不是简单的对话历史,而是结构化的任务状态。
三、Agent 与三个易混淆概念的区别
Tools:最小的能力积木
- 一个封装好的可调用函数
- 只负责执行,自己不做任何决策
- 如:搜索 API、发邮件 API、查询数据库
Agent:完整的决策系统
- 内部用 LLM 做大脑
- 自己判断「要不要调工具」「调哪个工具」「什么时候结束"
- 是主动的执行者
Workflow:确定性流程编排
- 开发者事先写好所有节点和流转逻辑
- 什么时候调什么工具、走什么分支,都是代码写死的
- LLM 只负责某个节点的执行,不负责流程决策
核心区分维度:谁来做"下一步该干什么"这个决策?
- Tools:不做决策,只执行
- Agent:自己决策
- Workflow:开发者替所有节点决策
四、为什么说 Agent 是 LLM 进化的必然?
你问 LLM:“帮我规划一个去三亚旅游的7天行程。”
如果没有工具:LLM 只能根据训练数据给出建议,信息可能已经过时,也无法查实时机票和酒店价格。
有了工具但没 Agent:你可以手动把多个工具的调用写好,串成一个流程。但问题是:不同的输入可能需要不同的流程。
有了 Agent:把目标交给它,它自己决定要不要查天气、查酒店、查景点,把所有信息汇总后再出方案,而且每个步骤都会有实时数据。
Agent 让 LLM 从一个「有知识的回答者」变成了一个「能行动的智能体」。
五、Agent 基础工作模式
最基础的 Agent 循环:
┌───────────────────┐
│ 用户输入目标 │
└─────────┬─────────┘
↓
┌─────────────────────────────────┐
│ LLM 分析目标,判断需要什么信息 │
└─────────────────┬───────────────┘
↓
┌─────────────────────────────────┐
│ LLM 决定调用哪个工具,输出参数 │
└─────────────────┬───────────────┘
↓
┌─────────────────────────────────┐
│ 代码执行工具,获取结果 │
└─────────────────┬───────────────┘
↓
┌─────────────────────────────────┐
│ 结果反馈给 LLM │
└─────────────────┬───────────────┘
↓
┌─────────────────────────────────┐
│ LLM 判断是否完成任务: │
│ → 未完成,继续循环 │
│ → 完成,输出最终答案 │
└─────────────────────────────────┘
这个循环跑几次(迭代次数取决于任务复杂度),最后输出综合答案。
六、从 Prompt 到 Agent 的思维转变
作为开发者,你需要从「写 prompt 让模型回答」转变为「设计一个系统让模型自主决策」。
核心设计要素:
- System Prompt:给模型设定 “你是谁、你能做什么、你的工具是什么”
- Tool Schema:精确定义工具的使用方式
- Memory 设计:管理中间状态和历史 context
- 终止条件:什么时候算完成了?
- 错误处理:工具调用失败怎么办?模型决策跑偏怎么办?
七、本章小结
- Agent 的质变在于"自主决策"和"行动-感知-调整闭环"
- Tools、Agent、Workflow 是三层不同粒度的概念,不是替代关系
- Agent 让 LLM 从"回答者"升级为"行动者"
- 开发 Agent 需要设计思维转变:从"写 prompt"到"设计自主系统"
思考题
- 一个天气预报查询任务,用纯 prompt、用 workflow、用 agent,三种方案各有什么优劣?
- Agent 的"自主决策"在哪些场景下是优势,在哪些场景下是风险?如何平衡自主性和可控性?