第10章:从 Prompt 到 Agent——AI 能力跃迁的分水岭

第10章:从 Prompt 到 Agent——AI 能力跃迁的分水岭

系列导读:本章是 Agent 模块的开篇。建议先看第1-5章建立 LLM 和工具调用的基础认知,再进入 Agent 的学习。


一、为什么说 Prompt 和 Agent 之间有一道鸿沟?

Prompt 时代:你给模型一个指令,模型给你一个回答。对话结束。

Agent 时代:你给模型一个目标,模型决定需要什么信息,去搜索、执行、验证,最终给你一个完整的解决方案。

这个分水岭就是:自主性(Autonomy)

能力 Prompt Agent
理解任务 被动接收指令 主动解析目标
工具调用 没有 自主决定用什么工具
多步执行 没有 可执行多步操作链
状态保持 无(每次独立) 有(记忆系统)
结果验证 没有 自检查/自修正
闭环能力 开环(输出即结束) 闭环(输出→行动→反馈→再决策)

二、理解 Agent:不是「加了工具的 LLM」

最常被误解的概念:Agent 不是"给 LLM 加了几个 Function Calling"。

真正的 Agent 有三个核心特征:

1. 自主决策

模型自己判断「下一步该做什么」,不是人类在每个节点发指令。

2. 行动-感知-调整闭环

模型执行一个行动(如搜索),收到结果,然后根据结果调整下一步的计划。

3. 状态管理

在多步执行过程中,模型知道自己之前做了什么、当前进展到哪一步。这不是简单的对话历史,而是结构化的任务状态

三、Agent 与三个易混淆概念的区别

Tools:最小的能力积木

  • 一个封装好的可调用函数
  • 只负责执行,自己不做任何决策
  • 如:搜索 API、发邮件 API、查询数据库

Agent:完整的决策系统

  • 内部用 LLM 做大脑
  • 自己判断「要不要调工具」「调哪个工具」「什么时候结束"
  • 是主动的执行者

Workflow:确定性流程编排

  • 开发者事先写好所有节点和流转逻辑
  • 什么时候调什么工具、走什么分支,都是代码写死的
  • LLM 只负责某个节点的执行,不负责流程决策

核心区分维度:谁来做"下一步该干什么"这个决策?

  • Tools:不做决策,只执行
  • Agent:自己决策
  • Workflow:开发者替所有节点决策

四、为什么说 Agent 是 LLM 进化的必然?

你问 LLM:“帮我规划一个去三亚旅游的7天行程。”

如果没有工具:LLM 只能根据训练数据给出建议,信息可能已经过时,也无法查实时机票和酒店价格。

有了工具但没 Agent:你可以手动把多个工具的调用写好,串成一个流程。但问题是:不同的输入可能需要不同的流程。

有了 Agent:把目标交给它,它自己决定要不要查天气、查酒店、查景点,把所有信息汇总后再出方案,而且每个步骤都会有实时数据。

Agent 让 LLM 从一个「有知识的回答者」变成了一个「能行动的智能体」。

五、Agent 基础工作模式

最基础的 Agent 循环:

            ┌───────────────────┐
            │   用户输入目标     │
            └─────────┬─────────┘
                      ↓
     ┌─────────────────────────────────┐
     │  LLM 分析目标,判断需要什么信息   │
     └─────────────────┬───────────────┘
                       ↓
     ┌─────────────────────────────────┐
     │  LLM 决定调用哪个工具,输出参数   │
     └─────────────────┬───────────────┘
                       ↓
     ┌─────────────────────────────────┐
     │  代码执行工具,获取结果          │
     └─────────────────┬───────────────┘
                       ↓
     ┌─────────────────────────────────┐
     │  结果反馈给 LLM                  │
     └─────────────────┬───────────────┘
                       ↓
     ┌─────────────────────────────────┐
     │  LLM 判断是否完成任务:           │
     │  → 未完成,继续循环              │
     │  → 完成,输出最终答案            │
     └─────────────────────────────────┘

这个循环跑几次(迭代次数取决于任务复杂度),最后输出综合答案。

六、从 Prompt 到 Agent 的思维转变

作为开发者,你需要从「写 prompt 让模型回答」转变为「设计一个系统让模型自主决策」。

核心设计要素:

  1. System Prompt:给模型设定 “你是谁、你能做什么、你的工具是什么”
  2. Tool Schema:精确定义工具的使用方式
  3. Memory 设计:管理中间状态和历史 context
  4. 终止条件:什么时候算完成了?
  5. 错误处理:工具调用失败怎么办?模型决策跑偏怎么办?

七、本章小结

  • Agent 的质变在于"自主决策"和"行动-感知-调整闭环"
  • Tools、Agent、Workflow 是三层不同粒度的概念,不是替代关系
  • Agent 让 LLM 从"回答者"升级为"行动者"
  • 开发 Agent 需要设计思维转变:从"写 prompt"到"设计自主系统"

思考题

  1. 一个天气预报查询任务,用纯 prompt、用 workflow、用 agent,三种方案各有什么优劣?
  2. Agent 的"自主决策"在哪些场景下是优势,在哪些场景下是风险?如何平衡自主性和可控性?