前面几课我们讲的是 Agent 怎么「想」、怎么「记」、怎么「规划」、怎么「协作」、怎么「检索知识」。到了第9课,话题要真正落地:把一个 Agent 从 Demo 变成能在公司里跑的生产系统。这一步最容易被忽略,却是分水岭。

一句话先立住:能跑通的 Agent 很多,能评估、能监控、能安全上线的 Agent 才是工业级。

第9课封面

一、为什么 Agent 很难评估

传统软件评估很简单:输入 A,断言输出等于 B,跑单元测试就行。Agent 不行,根子在一个词——不稳。

模型本身带随机性,同一个问题每次回答都可能有差异;加上多步链路,一步偏了后面全跟着歪。你没法用「写死断言」的方式去卡它。

更麻烦的是,Agent 的「结果对不对」常常需要人来判断:

| 难点

|

说明

输出随模型随机

|

同一 prompt 多次跑,答案可能不一样,没有唯一标准解

| |

多步链路放大偏差

|

规划偏一步,执行、检索全跟着跑偏

| |

工具调用会翻车

|

参数传错、接口超时,都可能让任务半路失败

| |

「对不对」难量化

|

很多时候要人读一遍才知道答得靠不靠谱

| |

指标互相打架

|

成功率高了,Token 可能也高了;体验好了,成本上去了

|

图片

所以评估 Agent 得换思路:不只看单次对不对,要统计一批任务的成功率;离线和线上两套评测一起上;用 Trace 把每一步摊开看。

二、Agent Eval 体系:两套一起上

工业级评测不会只靠「我觉得行」。它分两套:

图片

Offline离线评测:提前攒好一批有标准答案的测试集。每轮你改了模型、改了 Prompt、改了流程,就自动跑一遍,比对答案对不对。作用是上线前先挡住明显回退——别一发布发现比上周还差。

Online在线评测:盯着真实用户的反馈。用户点赞还是点踩?问题有没有被转去人工?线上悄悄做 A/B,看「理论上对」的方案「实际上用户买不买账」。

离线测「会不会做」,在线测「用户买不买账」——两条腿缺一不可。只跑离线,容易陷入自嗨;只看在线,又没法快速回归。

三、核心指标:盯住这五个

评估不能拍脑袋,得有看得见的数字。生产里最常用的是这五个:

图片

| 指标

|

它回答的问题

成功率

|

任务有没有跑通、答到点子上

| |

Tool 成功率

|

工具调用准不准,有没有调错或报错

| |

Token Cost

|

一轮花多少 token,直接关系到钱

| |

Latency

|

用户等了多久,影响体验

| |

幻觉率

|

瞎编的比例,这是红线指标

|

幻觉率尤其要单独盯。其它指标可以权衡(成功率 vs 成本),但「编东西」在金融、医疗、法务这类场景是零容忍,必须压到最低。

四、Trace 系统:把每一步摊开

出了问题时,光看最终输出是定位不到病因的。你需要一个Trace 系统,把每一次调用完整记录下来:

图片

| 记录项

|

内容

Prompt

|

当时喂给模型的指令是什么

| |

Tool

|

调了哪个工具、传了什么参数

| |

State

|

当时的记忆和中间状态

| |

Output

|

模型最终吐了什么

|

出问题时,顺着 Trace 一步步回放,就能定位是哪一步跑偏——是 Prompt 写歪了、工具调错了,还是记忆被污染了。没有 Trace,排错全靠猜。

五、Observability 可观测性工具

Trace 是数据,你还需要工具把它「看得见」。业界常用的三件套:

图片

| 工具

|

特点

LangSmith

|

LangChain 官方全家桶,Trace 可视、评测、回放一条龙,接 LLM 应用最顺手

| |

OpenTelemetry

|

业界通用可观测标准,不绑定某家框架,方便并入你现有的监控体系

| |

Phoenix

|

开源、专注 LLM 评测,向量检索可视化,便宜能自托管

|

不管选哪家,本质都是给 Agent 装一台「行车记录仪」:每一步都能被看见、被回放、被对比。

六、A/B 测试:Prompt 与模型对比

当你有两个方案(比如新 Prompt vs 旧 Prompt、新模型 vs 旧模型),别靠感觉选,用真实流量比:

图片

同一个任务,两版方案一起跑:一版用旧的,一版用新的,用真实流量比谁赢。重点看新版成功率高不高、Token 是更省还是更贵、用户满意度有没有涨、有没有引入新幻觉。

A/B 别踩坑:样本太小别急着下结论;两组流量要随机分;盯住多个指标别只看一个;跑够时长再切全量。不然「假胜利」上线后全翻车。

七、安全系统:上线前的三道防线

能跑、能评还不够,工业级 Agent 必须先过安全关。三道防线:

图片

| 防线

|

管什么

权限系统

|

能调哪些工具提前定死,敏感操作要审批,越权直接拦下

| |

沙箱

|

代码在隔离环境跑,碰不到真实生产库,炸了也不殃及主机

| |

审计日志

|

谁、何时、干了啥全记,出事能溯源,合规要留痕

|

权限管「能不能」、沙箱管「炸不炸」、审计管「查得出」——三道一起才稳。安全不是可选项,是上线的门票。

八、本节实战:生产级 Agent Monitoring

把上面这些拼起来,做一个能用的监控面板,至少要有三件套:

图片

| 能力

|

作用

Trace

|

每步可回放,问题秒定位

| |

Replay

|

拿历史输入重跑,对比改前改后差在哪

| |

Eval Dashboard

|

成功率 / Token / 幻觉率一屏看全,异常一眼发现

|

三件套合起来就是:看得见(Trace)、回得放(Replay)、评得准(Eval Dashboard)。一个 Agent 有了这三样,才谈得上「可运维」。

本课重点回顾

本课小结

Agent 难评估:输出随模型随机,得多步统计、不能写死断言

Eval 两套:Offline 测试集保下限,Online 真实反馈看上限

五个核心指标:成功率 / Tool 成功率 / Token / Latency / 幻觉率

Trace 系统:Prompt、Tool、State、Output 四样全记录

可观测工具:LangSmith / OpenTelemetry / Phoenix

A/B 测试:新 Prompt、新模型用真实流量比谁赢

安全三道防线:权限系统 / 沙箱 / 审计日志

实战 Monitoring 三件套:Trace + Replay + Eval Dashboard

工业级 Agent = 跑得动 + 看得清 + 守得住。下一课(第10课)我们会做一个系列总览,把这些能力串成一张完整的落地地图。

麒麟Agent实验室 · 日拱一卒,功不唐捐,和各位一起在 AI 时代无限进步