图片

写在前面

如果你用过 ChatGPT 或 Claude,你一定体验过这种交互:

你问一个问题 → 它回答一段话 → 结束。

这叫 ChatBot。但最近你肯定频繁听到另一个词:Agent

很多人第一反应是:“不就是会联网的 ChatGPT 吗?”

不是。

Agent 和 ChatBot 是两个完全不同的物种。今天这节课,我们就来彻底搞清楚:Agent 到底是什么?它由哪些部分组成?它凭什么能"做事"?

学完这一课,你会对 Agent 有一个结构化的完整认知,而不是停留在"好像挺厉害"的模糊感觉上。这是整个系列的地基——后面讲开发、讲实战,全都要回到这里。


一、什么是 Agent?

1.1 先看区别:Chat vs Agent

图片

左边是传统 ChatBot:输入 → 输出,一次性的。问完就没了,没有记忆,不会动手做任何事。

右边是 Agent:目标 → 思考 → 调工具 → 看结果 → 再决策 → 完成。它是一个持续运转的系统。

**核心区别只有一条:**ChatBot 只会"说话",Agent 会"行动"。它能自己判断该用什么工具,执行完之后根据结果继续调整策略。

1.2 Agent 的公式

图片

用一句话概括:

Agent = LLM(大脑)+ State(状态)+ Tool(工具)+ Goal(目标)+ Loop(执行循环)

  • LLM:负责思考和决策(不是回答问题那么简单,而是"我下一步该做什么?")

  • 状态:记录当前做到哪步了、已经做了什么、哪些失败了

  • 工具:让模型能"出手"——搜索、查数据库、调 API、跑代码

  • 目标:告诉它要完成什么任务

  • 循环:不断重复「观察→思考→行动」直到达成目标

缺任何一个,都算不上真正的 Agent。后面我们逐个拆开来讲。


二、Agent 的五大核心模块

图片

🧠 推理层 Reasoning

这是 Agent 的"大脑前额叶"。负责三件事:

  1. 思考:理解用户意图,拆解复杂任务为子步骤
  2. 决策:在多个可选动作中选出最优的一个
  3. 反思:回顾之前的步骤是否有效,调整策略

典型模式包括 ReAct(边推理边行动)、Chain of Thought(思维链)、Reflection(自我反思)。这些不是花哨的名字,它们决定了 Agent 遇到问题时怎么"想"。

🔧 工具层 Tool Use

“光说不练假把式”。工具层就是 Agent 的"手":

  • 搜索引擎 —— 获取实时信息

  • API 调用 —— 查天气、查股票、发邮件

  • 数据库查询 —— 读业务数据

  • 代码执行 —— 跑 Python/SQL,处理计算

**本质分工:**LLM 负责"想",工具负责"干"。模型只做决策(选哪个工具、传什么参数),实际执行由外部系统完成。

📋 状态层 State

一个跑了几轮的 Agent,必须知道:

  • 当前做到第几步了?

  • 已经完成了什么?

  • 哪些操作失败了?

  • 还剩什么没做?

常见实现形式有 JSON 对象、有向无环图(DAG)、任务队列等。没有状态的 Agent 就像失忆症患者——每次都在原地打转。

🧠 记忆层 Memory

图片

Agent 有三种"记性":

♻️ 执行循环 Agent Loop

图片

这是 Agent 最核心的设计模式——一个永不停止的四步循环:

  1. Observe(观察):看看环境现在是什么状态,拿到新的输入或工具返回的结果
  2. Think(思考):结合目标和当前状态,决定下一步要做什么
  3. Act(行动):调用某个工具或输出某个响应
  4. Reflect(反思):评估这次行动的效果,更新状态

然后回到 Step 1,周而复始。直到判定任务完成,循环才停止。


三、Agent 与 Workflow 的区别

这是初学者最容易混淆的概念之一。很多人以为"写个流程控制脚本"就是在做 Agent 了。

图片

简单来说:**Workflow 是你画好路线让程序跑;Agent 是你给它目的地让它自己找路。**两者不是对立关系——好的 Agent 架构内部往往也包含 Workflow 来管理子任务的执行。


四、主流 Agent 框架速览

图片

市面上框架很多,这里挑四个最有代表性的快速过一遍:

LangChain

生态最大,Tool 最多,社区最活跃。优点:上手快、集成广。注意:抽象层比较重,Debug 困难,内部实现像黑盒。适合快速原型验证,生产级项目需要谨慎评估。

LangGraph

LangChain 官方推出的新框架,核心理念是 State Machine + DAG。把 Agent 的状态流转可视化地表达出来。特别适合生产级 Agent——可观测、可调试、可控。

AutoGen(微软)

主打 多 Agent 协作——多个 Agent 角色之间通过对话完成任务。适合需要"团队协作"场景,比如一个 Agent 写代码、一个 Agent review、一个 Agent 测试。

CrewAI

基于 角色 Role-playing 协作模式。轻量易上手,定义几个角色(研究员、写手、编辑),给它们各自的任务和工具,自动协作完成工作流。

💡 **我的建议:**不要纠结"选哪个最好"。先理解原理(就是今天这篇的内容),再根据你的具体场景去选框架。没有最好的框架,只有最适合的。


五、四种经典架构模式

图片

① ReAct:边推理边行动

Reasoning + Acting 结合。Agent 在每一步都会先写出自己的推理过程(Thought),然后决定采取哪个行动(Action)。拿到 Action 结果后,再进入下一轮 Thought-Action 循环。最经典的 Agent 模式,也是大多数教程的起点。

② Plan-and-Execute:先规划再执行

先花一轮(或多轮)生成完整的执行计划(Plan),然后按计划逐步执行,遇到问题时可以回退修改计划。大局观更强,适合复杂的多步骤任务。代价是前期规划可能出错,需要配合 Reflection 机制修正。

③ Reflection:自我反思

在关键节点停下来,让 Agent 回顾之前的步骤:“我刚才做的这个决定对吗?有没有更好的方案?" 反思机制能显著降低错误率,特别是在需要精确性的场景(如编程、数据分析)。

④ Self-Correction:自动修复错误

当工具返回报错、或者结果不符合预期时,Agent 不直接放弃,而是自动诊断原因并重试。可能换个参数、换一种方法、甚至换一个工具。这是让 Agent 具备"鲁棒性"的关键设计。

实际工程中,这些模式经常组合使用。比如 Plan-and-Execute + Self-Correction + Reflection 就是很多生产级 Agent 的标配。


六、实战:搭建一个"联网搜索 Agent”

图片

理论讲完了,我们来落地。用一个最简单的例子串联上面所有的概念:

**需求:**用户提一个问题,Agent 判断是否需要联网搜索,如果需要就调搜索引擎获取信息,最后总结成答案返回。

技术栈选择:

  • LLM:OpenAI API(GPT-4o / Claude 等)—— 负责判断和总结

  • 搜索工具:Tavily Search API(或 Serper、Google Custom Search)

  • 编排框架:LangChain(快速原型)或 LangGraph(生产级)

核心流程就四步(对应上面的 Loop):用户提问 → Agent 思考"这个问题需要搜吗?" → 调 Tavily 搜索 → 用搜索结果组织答案返回。

下一节课我们会亲手把这个 Agent 写出来,一行行代码带你跑通。今天先把概念地基打好。


七、本节重点误区

图片

✗ 最大误区:把 Agent 当成"高级 Prompt"

很多人觉得 Agent 就是在 Prompt 里加几句"You are an agent that can search the web…",然后调个带 function calling 的 API 就完了。

这样做的本质还是 ChatBot——只不过多了个 function call 而已。真正的 Agent 区别在于:

✓ Agent 的真正核心

  • 状态管理:知道自己在哪一步,不迷失

  • 执行循环:自主运转直到目标达成

  • 工具编排:动态组合工具链,而非硬编码

Prompt 决定的是"模型如何思考",但 Agent 的灵魂在系统层面的架构设计——状态怎么存、循环怎么控、失败怎么恢复。这才是区分高手和新手的分水岭。


小结 & 下节预告

今天这节课,我们从零建立了对 Agent 的完整认知框架:

  1. Agent ≠ ChatBot:前者会行动、后者只会说话
  2. 五大模块:推理、工具、状态、记忆、执行循环,缺一不可
  3. vs Workflow:Agent 自主找路,Workflow 走固定路线
  4. 四种模式:ReAct、Plan-and-Execute、Reflection、Self-Correction
  5. 核心误区:Agent 不是高级 Prompt,真正的功夫在状态管理和执行循环

— END —

 觉得有用?点个「在看」,下篇继续 👇
关注「麒麟 Agent 实验室」,一起在 AI 时代日拱一卒。