Agent学习系列 第9课:Agent 评估、监控与生产化
前面几课我们讲的是 Agent 怎么「想」、怎么「记」、怎么「规划」、怎么「协作」、怎么「检索知识」。到了第9课,话题要真正落地:把一个 Agent 从 Demo 变成能在公司里跑的生产系统。这一步最容易被忽略,却是分水岭。
一句话先立住:能跑通的 Agent 很多,能评估、能监控、能安全上线的 Agent 才是工业级。
一、为什么 Agent 很难评估
传统软件评估很简单:输入 A,断言输出等于 B,跑单元测试就行。Agent 不行,根子在一个词——不稳。
模型本身带随机性,同一个问题每次回答都可能有差异;加上多步链路,一步偏了后面全跟着歪。你没法用「写死断言」的方式去卡它。
更麻烦的是,Agent 的「结果对不对」常常需要人来判断:
| 难点
|
说明
输出随模型随机
|
同一 prompt 多次跑,答案可能不一样,没有唯一标准解
| |
多步链路放大偏差
|
规划偏一步,执行、检索全跟着跑偏
| |
工具调用会翻车
|
参数传错、接口超时,都可能让任务半路失败
| |
「对不对」难量化
|
很多时候要人读一遍才知道答得靠不靠谱
| |
指标互相打架
|
成功率高了,Token 可能也高了;体验好了,成本上去了
|
所以评估 Agent 得换思路:不只看单次对不对,要统计一批任务的成功率;离线和线上两套评测一起上;用 Trace 把每一步摊开看。
二、Agent Eval 体系:两套一起上
工业级评测不会只靠「我觉得行」。它分两套:
Offline离线评测:提前攒好一批有标准答案的测试集。每轮你改了模型、改了 Prompt、改了流程,就自动跑一遍,比对答案对不对。作用是上线前先挡住明显回退——别一发布发现比上周还差。
Online在线评测:盯着真实用户的反馈。用户点赞还是点踩?问题有没有被转去人工?线上悄悄做 A/B,看「理论上对」的方案「实际上用户买不买账」。
离线测「会不会做」,在线测「用户买不买账」——两条腿缺一不可。只跑离线,容易陷入自嗨;只看在线,又没法快速回归。
三、核心指标:盯住这五个
评估不能拍脑袋,得有看得见的数字。生产里最常用的是这五个:
| 指标
|
它回答的问题
成功率
|
任务有没有跑通、答到点子上
| |
Tool 成功率
|
工具调用准不准,有没有调错或报错
| |
Token Cost
|
一轮花多少 token,直接关系到钱
| |
Latency
|
用户等了多久,影响体验
| |
幻觉率
|
瞎编的比例,这是红线指标
|
幻觉率尤其要单独盯。其它指标可以权衡(成功率 vs 成本),但「编东西」在金融、医疗、法务这类场景是零容忍,必须压到最低。
四、Trace 系统:把每一步摊开
出了问题时,光看最终输出是定位不到病因的。你需要一个Trace 系统,把每一次调用完整记录下来:
| 记录项
|
内容
Prompt
|
当时喂给模型的指令是什么
| |
Tool
|
调了哪个工具、传了什么参数
| |
State
|
当时的记忆和中间状态
| |
Output
|
模型最终吐了什么
|
出问题时,顺着 Trace 一步步回放,就能定位是哪一步跑偏——是 Prompt 写歪了、工具调错了,还是记忆被污染了。没有 Trace,排错全靠猜。
五、Observability 可观测性工具
Trace 是数据,你还需要工具把它「看得见」。业界常用的三件套:
| 工具
|
特点
LangSmith
|
LangChain 官方全家桶,Trace 可视、评测、回放一条龙,接 LLM 应用最顺手
| |
OpenTelemetry
|
业界通用可观测标准,不绑定某家框架,方便并入你现有的监控体系
| |
Phoenix
|
开源、专注 LLM 评测,向量检索可视化,便宜能自托管
|
不管选哪家,本质都是给 Agent 装一台「行车记录仪」:每一步都能被看见、被回放、被对比。
六、A/B 测试:Prompt 与模型对比
当你有两个方案(比如新 Prompt vs 旧 Prompt、新模型 vs 旧模型),别靠感觉选,用真实流量比:
同一个任务,两版方案一起跑:一版用旧的,一版用新的,用真实流量比谁赢。重点看新版成功率高不高、Token 是更省还是更贵、用户满意度有没有涨、有没有引入新幻觉。
A/B 别踩坑:样本太小别急着下结论;两组流量要随机分;盯住多个指标别只看一个;跑够时长再切全量。不然「假胜利」上线后全翻车。
七、安全系统:上线前的三道防线
能跑、能评还不够,工业级 Agent 必须先过安全关。三道防线:
| 防线
|
管什么
权限系统
|
能调哪些工具提前定死,敏感操作要审批,越权直接拦下
| |
沙箱
|
代码在隔离环境跑,碰不到真实生产库,炸了也不殃及主机
| |
审计日志
|
谁、何时、干了啥全记,出事能溯源,合规要留痕
|
权限管「能不能」、沙箱管「炸不炸」、审计管「查得出」——三道一起才稳。安全不是可选项,是上线的门票。
八、本节实战:生产级 Agent Monitoring
把上面这些拼起来,做一个能用的监控面板,至少要有三件套:
| 能力
|
作用
Trace
|
每步可回放,问题秒定位
| |
Replay
|
拿历史输入重跑,对比改前改后差在哪
| |
Eval Dashboard
|
成功率 / Token / 幻觉率一屏看全,异常一眼发现
|
三件套合起来就是:看得见(Trace)、回得放(Replay)、评得准(Eval Dashboard)。一个 Agent 有了这三样,才谈得上「可运维」。
本课重点回顾
Agent 难评估:输出随模型随机,得多步统计、不能写死断言
Eval 两套:Offline 测试集保下限,Online 真实反馈看上限
五个核心指标:成功率 / Tool 成功率 / Token / Latency / 幻觉率
Trace 系统:Prompt、Tool、State、Output 四样全记录
可观测工具:LangSmith / OpenTelemetry / Phoenix
A/B 测试:新 Prompt、新模型用真实流量比谁赢
安全三道防线:权限系统 / 沙箱 / 审计日志
实战 Monitoring 三件套:Trace + Replay + Eval Dashboard
工业级 Agent = 跑得动 + 看得清 + 守得住。下一课(第10课)我们会做一个系列总览,把这些能力串成一张完整的落地地图。
麒麟Agent实验室 · 日拱一卒,功不唐捐,和各位一起在 AI 时代无限进步
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai002/post/20260817/Agent%E5%AD%A6%E4%B9%A0%E7%B3%BB%E5%88%97-%E7%AC%AC9%E8%AF%BEAgent-%E8%AF%84%E4%BC%B0%E7%9B%91%E6%8E%A7%E4%B8%8E%E7%94%9F%E4%BA%A7%E5%8C%96/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com